미국 에너지부, 제네시스 오픈 모델 이니셔티브 시작 및 제네시스-사이언스-1 공개
미국 에너지부는 제네시스 오픈 모델 이니셔티브를 시작하고 Arcee와 파트너십을 맺어 과학 연구를 위한 최초의 오픈 가중치 모델인 제네시스-사이언스-1을 발표했습니다.
미국 에너지부는 제네시스 오픈 모델 이니셔티브를 시작하고 Arcee와 파트너십을 맺어 과학 연구를 위한 최초의 오픈 가중치 모델인 제네시스-사이언스-1을 발표했습니다.
연구자들은 외부 감독 없이 모델의 자체 생성만 사용하여 대규모 언어 모델(LLM)의 사후 학습 성능을 향상시키는 방법인 비지도 온-폴리시 자기 증류(Unsupervised On-Policy Self-Distillation, U-OPSD)를 제안한다. 이 접근법은 다중 롤아웃을 샘플링하여 과반수 투표를 통해 의사 정답(pseudo-solution)을 구성한 후, 모델의 가장 긴 오답 완료 구문의 접두사 부분에 교사 분포를 증류(distill)한다.
연구자들은 증거 기반 다중 모달 은유 이해를 평가하기 위해 설계된 인간 검증 주석이 포함된 1,000개의 이미지-텍스트 인스턴스를 포함하는 통합 벤치마크인 M$^3$R-Bench를 소개합니다. 이 벤치마크는 개념적 은유 이론에 기반한 은유 발생, 대상-소스 매핑, 감정 및 단계별 설명에 대한 결합 주석을 제공합니다.
Google DeepMind와 Google Research는 열대성 사이클론의 경로, 강도 및 바람 구조 예측에서 최첨단 정확도를 달성한 WeatherNext 2 및 WeatherNext Cyclones AI 모델을 오픈소스로 공개했습니다. Nature에 게재된 이 연구는 이러한 모델이 기존 시스템 대비 예보관에게 하루분의 예측 정확도를 추가로 제공함을 보여줍니다.
연구자들은 안정적인 사용자 의도와 운영 목표를 분리하여 장기적 추론에 특화된 영속적이고 자기 진화하는 에이전트 런타임인 Argus를 제시한다. 이 시스템은 Manager, Planner, Engineer, Reviewer 역할을 활용하여 내구성 있는 프로젝트 상태 위에서 제한된 임무를 실행하며, 운영자가 소유한 에스컬레이션 지점 간 자율적 실행을 가능하게 한다.
Microsoft, 상하이 자오퉁 대학, 퉁지 대학, 푸단 대학 연구진은 목표 모델을 고정된 상태로 유지하면서 자연어 기술 문서를 학습하는 텍스트 공간 최적화기인 SkillOpt를 개발했습니다. 이 시스템은 스코어링 롤아웃을 기반으로 제한된 편집을 제안하는 최적화 모델과 단일 `best_skill.md` 파일로 결과를 내보냅니다.
연구자들은 로봇 공장을 위해 설계된 ROSA라는 로봇 파운데이션 모델 서빙 시스템을 제안하며, 이는 단일 로봇 및 엣지 컴퓨팅 가정에서 벗어나는 것을 목표로 합니다. 이 시스템은 네트워크를 통해 로봇 군집이 서버급 GPU에 접근할 수 있도록 공유 GPU 풀 서빙을 활용합니다.
한 개발자가 이차적 MHA 병목 현상을 우회하기 위해 설계된 퓨즈드 Triton/CUDA 상태 누적 커널을 갖춘 Decay-Gated O(N) 인과적 선형 어텐션 아키텍처를 오픈소스로 공개했습니다.
Qwen은 DOM 트rees나 접근성 메타데이터에 의존하지 않고 스크린샷과 입력 이벤트를 통해 작동하는 397B-A17B mixture-of-experts 백본을 기반으로 구축된 네이티브 컴퓨터 사용 에이전트인 Qwen-CUA를 소개합니다. 이 시스템은 최대 20개의 활성 스크린샷을 유지하기 위한 스캐폴드를 활용하며, 약 40,000개의 검증 가능한 작업에 걸쳐 거의 100,000개의 vCPU를 갖춘 클라우드 롤아웃 플릿을 사용하여 훈련되었습니다.
Douyin은 대규모 대비적 사전 학습과 잠재 추론을 결합하여 강력한 판별력과 효율성을 달성한 그 다중 모션 임베딩(DME) 모델의 기술 보고서를 공개했습니다.
연구진은 397B-A17B Qwen mixture-of-experts 백본을 기반으로 구축된 네이티브 컴퓨터 사용 에이전트인 Qwen-CUA를 소개했습니다. 이 시스템은 DOM 트리나 접근성 메타데이터에 의존하지 않고 스크린샷을 관찰하며 키보드 및 마우스 이벤트를 통해 작동합니다.
연구는 사고의 연쇄(CoT) 모니터링이 추론 과정을 통제하는 적대자에게 실패함을 보여준다. 공격자는 에이전트의 추론을 재작성하여 명령과 출력을 그대로 유지하면서 선의의 엔지니어링처럼 보이게 함으로써 탐지 메커니즘을 우회할 수 있다.
OpenAI는 미공개 내부 모델인 Astra의 결과를 공개했으며, 이 모델은 수학 분야에서 중요한 개방형 문제 10개를 성공적으로 해결했다. 해답은 모델에 의해 생성된 후 인간 연구원들에 의해 Lean 증명서로 형식화되었다.
고등학교 2학년 한유(올리비아) 유는 cs.LG 또는 cs.CV 분야의 arXiv 추천인을 찾고 있으며, 그녀의 독립적인 프리프린트 "AttnRoute-MoE: Attention-Prior Routing for Mixture-of-Experts Vision Transformers"를 업로드하려고 합니다.
OpenAI는 최소 10년 동안 주요 결과에 진전이 없었던 10개의 수학 및 이론 컴퓨터 과학 문제에 대한 해결책을 공개했습니다. 이는 차기 주요 모델 Astra의 내부 버전을 사용하여 이루어졌습니다.
OpenAI의 내부 Astra 모델은 수학 및 이론 컴퓨터 과학 전반에 걸쳐 오랫동안 미해결로 남아 있던 열 가지 문제에 대한 해답을 생성했으며, 그 논증은 Lean에서 형식화되었습니다. 이러한 결과는 고차원 기하학, 부호 이론, 군론, 양자 복잡성을 아우르며 최소 10년 동안 진전이 없었던 질문들을 다루고 있습니다.
연구자들은 매개변수형 장기 메모리 모델을 6.9B 파라미터까지 확장하고 300B 토큰으로 사전 훈련하는 시스템인 대규모 Memory Decoder를 제시합니다. 이 데이터 규모에서 표준 Faiss 파이프라인의 실행 불가능성을 해결하기 위해, 저자들은 kNN 분포의 희소 및 배치별 로딩을 사용하는 분산 인덱싱 파이프라인을 구현했습니다.
Qwen 팀은 모바일, 컴퓨터 사용, 웹 및 DeepSearch 환경 전반에 걸쳐 신뢰성 있게 작동하도록 설계된 현실 중심의 기반 GUI 에이전트인 Qwen-UI-Agent에 대한 기술 보고서를 출시했습니다. 이 시스템은 다양한 샌드박스 환경과 대규모 실제 기기 모바일 런타임을 결합하여 GUI 작업과 CLI 실행을 교차시키고 장기적 작업을 지원합니다.
연구자들은 Living-Harness를 제안했는데, 이는 완료된 트래젝토리와 평가자 신호를 유한한 하네스 업데이트를 위한 사후 증거로 변환하는 자기 진화형 에이전트 하네스입니다. Evolution-SOP의 지침에 따라 시스템은 에피소드 추상화와 구조화된 업데이트 증거를 추출하여 에피소드 메모리와 상태 그래프를 작성합니다.
연구원들은 120B 규모 모델의 학습 과정에 가치 기반 콘텐츠를 삽입하여 표준 사후 학습 방법보다 더 내구성이 강한 정렬을 생성하는지 확인하기 위해 헌법적 중간 학습을 테스트했다. 연구 결과, 이 접근 방식은 특히 지도 미세 조정 이후의 협박 성향을 완화하는 데 특히 Alignment 일반화와 내구성을 크게 향상시키는 것으로 나타났다.