Research paper
arxiv arXiv cs.LG · 2일 전

U-OPSD는 LLM을 위한 비지도 온-폴리시 자기 증류(Self-Distillation)를 가능하게 한다

연구자들은 외부 감독 없이 모델의 자체 생성만 사용하여 대규모 언어 모델(LLM)의 사후 학습 성능을 향상시키는 방법인 비지도 온-폴리시 자기 증류(Unsupervised On-Policy Self-Distillation, U-OPSD)를 제안한다. 이 접근법은 다중 롤아웃을 샘플링하여 과반수 투표를 통해 의사 정답(pseudo-solution)을 구성한 후, 모델의 가장 긴 오답 완료 구문의 접두사 부분에 교사 분포를 증류(distill)한다.

arxiv arXiv cs.CL · 2일 전

M$^3$R-Bench는 다중 모달 은유 이해를 위한 증거 기반 벤치마크를 소개합니다

연구자들은 증거 기반 다중 모달 은유 이해를 평가하기 위해 설계된 인간 검증 주석이 포함된 1,000개의 이미지-텍스트 인스턴스를 포함하는 통합 벤치마크인 M$^3$R-Bench를 소개합니다. 이 벤치마크는 개념적 은유 이론에 기반한 은유 발생, 대상-소스 매핑, 감정 및 단계별 설명에 대한 결합 주석을 제공합니다.

lab Google DeepMind Blog · 3일 전 · 조회수 16회

Google DeepMind, 사이클론 예보를 위한 WeatherNext AI 모델을 오픈소스로 공개

Google DeepMind와 Google Research는 열대성 사이클론의 경로, 강도 및 바람 구조 예측에서 최첨단 정확도를 달성한 WeatherNext 2 및 WeatherNext Cyclones AI 모델을 오픈소스로 공개했습니다. Nature에 게재된 이 연구는 이러한 모델이 기존 시스템 대비 예보관에게 하루분의 예측 정확도를 추가로 제공함을 보여줍니다.

arxiv arXiv cs.AI · 3일 전 SWE-bench Pro · 78.0%

Argus: 장기적 추론을 위한 범용 에이전트 런타임

연구자들은 안정적인 사용자 의도와 운영 목표를 분리하여 장기적 추론에 특화된 영속적이고 자기 진화하는 에이전트 런타임인 Argus를 제시한다. 이 시스템은 Manager, Planner, Engineer, Reviewer 역할을 활용하여 내구성 있는 프로젝트 상태 위에서 제한된 임무를 실행하며, 운영자가 소유한 에스컬레이션 지점 간 자율적 실행을 가능하게 한다.

media MarkTechPost · 3일 전

Microsoft의 SkillOpt는 Codex와 Claude Code 간 에이전트 기술 이전을 가능하게 함

Microsoft, 상하이 자오퉁 대학, 퉁지 대학, 푸단 대학 연구진은 목표 모델을 고정된 상태로 유지하면서 자연어 기술 문서를 학습하는 텍스트 공간 최적화기인 SkillOpt를 개발했습니다. 이 시스템은 스코어링 롤아웃을 기반으로 제한된 편집을 제안하는 최적화 모델과 단일 `best_skill.md` 파일로 결과를 내보냅니다.

arxiv arXiv cs.LG · 5일 전 OSWorld 2.0 · 21.2% · 조회수 6회

Qwen, 397B-A17B 네이티브 컴퓨터 사용 에이전트 Qwen-CUA 출시

Qwen은 DOM 트rees나 접근성 메타데이터에 의존하지 않고 스크린샷과 입력 이벤트를 통해 작동하는 397B-A17B mixture-of-experts 백본을 기반으로 구축된 네이티브 컴퓨터 사용 에이전트인 Qwen-CUA를 소개합니다. 이 시스템은 최대 20개의 활성 스크린샷을 유지하기 위한 스캐폴드를 활용하며, 약 40,000개의 검증 가능한 작업에 걸쳐 거의 100,000개의 vCPU를 갖춘 클라우드 롤아웃 플릿을 사용하여 훈련되었습니다.

lab OpenAI News · 8일 전 · 조회수 16회

Astra 모델이 수학 및 이론 컴퓨터 과학의 열 가지 미해결 문제를 해결하다

OpenAI의 내부 Astra 모델은 수학 및 이론 컴퓨터 과학 전반에 걸쳐 오랫동안 미해결로 남아 있던 열 가지 문제에 대한 해답을 생성했으며, 그 논증은 Lean에서 형식화되었습니다. 이러한 결과는 고차원 기하학, 부호 이론, 군론, 양자 복잡성을 아우르며 최소 10년 동안 진전이 없었던 질문들을 다루고 있습니다.

arxiv arXiv cs.CL · 9일 전 · 조회수 2회

대규모 메모리 디코더: 매개변수형 장기 메모리를 6.9B 파라미터로 확장

연구자들은 매개변수형 장기 메모리 모델을 6.9B 파라미터까지 확장하고 300B 토큰으로 사전 훈련하는 시스템인 대규모 Memory Decoder를 제시합니다. 이 데이터 규모에서 표준 Faiss 파이프라인의 실행 불가능성을 해결하기 위해, 저자들은 kNN 분포의 희소 및 배치별 로딩을 사용하는 분산 인덱싱 파이프라인을 구현했습니다.

arxiv arXiv cs.AI · 9일 전 WebArena · 73.6% · 조회수 2회

Qwen-UI-Agent가 모바일 사용 벤치마크에서 최첨단 성능을 달성하다

Qwen 팀은 모바일, 컴퓨터 사용, 웹 및 DeepSearch 환경 전반에 걸쳐 신뢰성 있게 작동하도록 설계된 현실 중심의 기반 GUI 에이전트인 Qwen-UI-Agent에 대한 기술 보고서를 출시했습니다. 이 시스템은 다양한 샌드박스 환경과 대규모 실제 기기 모바일 런타임을 결합하여 GUI 작업과 CLI 실행을 교차시키고 장기적 작업을 지원합니다.

arxiv arXiv cs.CL · 10일 전 · 조회수 4회

Living-Harness가 자체 진화하는 에이전트 하네스를 통해 Pass@1을 약 10포인트 향상

연구자들은 Living-Harness를 제안했는데, 이는 완료된 트래젝토리와 평가자 신호를 유한한 하네스 업데이트를 위한 사후 증거로 변환하는 자기 진화형 에이전트 하네스입니다. Evolution-SOP의 지침에 따라 시스템은 에피소드 추상화와 구조화된 업데이트 증거를 추출하여 에피소드 메모리와 상태 그래프를 작성합니다.

arxiv arXiv cs.CL · 10일 전 · 조회수 3회

헌법적 중간 학습은 능력 손실 없이 지속 가능한 정렬 이점을 산출한다

연구원들은 120B 규모 모델의 학습 과정에 가치 기반 콘텐츠를 삽입하여 표준 사후 학습 방법보다 더 내구성이 강한 정렬을 생성하는지 확인하기 위해 헌법적 중간 학습을 테스트했다. 연구 결과, 이 접근 방식은 특히 지도 미세 조정 이후의 협박 성향을 완화하는 데 특히 Alignment 일반화와 내구성을 크게 향상시키는 것으로 나타났다.