컴퓨터 사용 에이ント 훈련을 위한 Echoverse 출시
Microsoft Research는 컴퓨터 사용 에이전트를 훈련시키기 위해 설계된 12개의 심층 합성 환경 모음인 Echoverse를 출시했습니다. 이 이니셔티브에는 도메인 특화 세계 10개와 능력 중심 세계 2개가 포함되어 있으며, 모두 일관된 상태와 행동 충실도를 유지하도록 구축되었습니다.
Microsoft Research는 컴퓨터 사용 에이전트를 훈련시키기 위해 설계된 12개의 심층 합성 환경 모음인 Echoverse를 출시했습니다. 이 이니셔티브에는 도메인 특화 세계 10개와 능력 중심 세계 2개가 포함되어 있으며, 모두 일관된 상태와 행동 충실도를 유지하도록 구축되었습니다.
새로운 논문은 제한된 예산 설정에서 일반적으로 수동 접근 방식에 의존하는 프로세스인 하이퍼파라미터 최적화(HPO)를 자동화하기 위해 기초 대규모 언어 모델(LLM)을 사용하는 것을 탐구합니다. 저자들은 데이터셋 및 모델 설명에 기반하여 LLM이 하이퍼파라미터 구성을 제안하고, 이를 모델 성능에 따라 반복적으로 정제하는 방법론을 개발했습니다.
연구자들은 영향 함수의 계산 효율성과 언롤링 기반 접근법의 정확성을 결합한 새로운 훈련 데이터 속성 추정(TDA) 방법인 Source를 소개합니다. 영향 함수와 유사한 공식을 사용하여 언롤링 미분을 근사함으로써, Source는 최적화 편향이나 다단계 파이프라인을 고려하지 않는다는 암시적 미분 방법의 한계를 해결합니다.
이 논문은 JacNet을 소개합니다. JacNet은 매핑 자체 대신 입력-출력 함수의 야코비안을 직접 학습하는 신경망 아키텍처입니다. 이 접근 방식은 미분 특성에 대한 정밀한 제어를 가능하게 하여 가역성 및 k-Lipschitz 연속성과 같은 구조적 사전 지식을 강제할 수 있습니다.
본 기사는 대규모 딥러닝 설정에 이중 수준 또는 중첩 최적화를 적용하는 과제를 다루는 jlorraine 의 논문을 소개합니다. 그래디언트 기반 최적화는 일반적으로 단일 매개변수 집합을 업데이트하지만, 많은 응용 프로그램에서는 서로 중첩된 다른 목적 함수에 대해 매개변수 부분 집합을 업데이트해야 합니다.
연구원들은 에지 배포에 적합한 컴팩트한 버전으로 대규모 비전-언어 모델을 증류하기 위한 마스크 점진적 강화 학습 프레임워크인 Masters를 제안합니다. 이 방법은 교사 및 학생 모델 간의 크기 차이로 인한 불안정성을 해결합니다.
연구자들은 지식 증류의 취약성과 강화학습에서의 드리프트(drift) 문제를 해결하기 위해 정책 그래디언트가 아닌 프롬프트에 교사 지식을 주입하는 방법인 근접 정책 최적화 영역(Zone of Proximal Policy Optimization, ZPPO)을 소개한다. ZPPO는 어려운 질문에 대해 이진 후보 포함 질문(Binary Candidate-included Questions, BCQ)과 부정 후보 포함 질문(Negative Candidate-included Questions, NCQ)을 구성하고, 학생의 정확도가 향상되거나 제외될 때까지 리플레이 버퍼를 통해 이를 순환시킨다.
Microsoft Research는 추론 중 정답 레이블이나 외부 피드백 없이도 대규모 언어 모델이 자신의 경험으로부터 학습할 수 있는 프레임워크인 EvoLib를 도입했습니다. EvoLib는 원시 경험을 정적 메모리로 저장하는 대신, 지속적으로 정제되고 통합되며 재가중되는 재사용 가능한 기술과 반성적 통찰력으로 변환합니다.
DharmaOCR은 도메인 특화 훈련을 통해 Mistral OCR4 및 Unlimited-OCR보다 브라질 포르투갈어에서 더 높은 추출 품질과 안정성을 달성합니다.
ThetaMem은 재귀적 혼합기(recurrent mixer)에 대한 초기 단일 시드 연구로, 게이트 메커니즘을 정교화하는 대신 학습된 부호 있는 하다마르 또는 외적(key lifts)을 통해 재귀 상태를 수정합니다. 저자는 합성 벤치마크에서 혼합된 결과를 제시하며, 접근 방식을 반증할 수 있는 가장 저렴한 실험을 식별하기 위해 비판을 명시적으로 구합니다.
Dyna Robotics는 시점 인간 영상 100만 시간 이상으로 사전 학습된 로봇 조작용 월드 액션 모델인 Dyna-2를 출시했습니다. 동사는 1,000시간에서 1,000,000시간까지의 스케일링 법칙을 확립함으로써 일반 인간 영상이 액션 레이블 데이터의 대체재가 될 수 있음을 입증했습니다.
연구진은 오픈 대규모 언어 모델에 레퍼런스 없는 사후 학습을 적용하는 다국어 기계 번역 모델인 MiLMMT-46-v1.0을 개발했습니다. 연구팀은 언어 식별에 의해 게이트되는 두 개의 레퍼런스 없는 품질 추정 모델을 기반으로 한 보상과 함께 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)를 사용합니다.
연구자들이 레퍼런스 없는 사후 학습을 활용하는 다국어 기계 번역용 오픈 대규모 언어 모델인 MiLMMT-46-v1.0을 공개했습니다. 감독 학습 파인튜닝된 MiLMMT-46-v0.1을 기반으로, 연구팀은 언어 식별에 의해 게이트되는 두 개의 레퍼런스 없는 품질 추정 모델을 기반으로 한 보상과 함께 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)를 적용했습니다.
멀티버스 컴퓨팅은 오프라인 top-K 로짓 캐싱과 융합 청크형 켈러백-라이블러(KL) 발산 손실을 결합하여 대규모 언어 모델 지식 증류를 위한 메모리 효율적인 접근 방식을 소개합니다. 이 방법은 교사와 학생 모델을 동시에 메모리에 유지할 필요성을 제거하여 VRAM 요구 사항을 대폭 줄입니다.
ByteDance는 AI 증류 기술에 의존하지 않고 차세대 AI 모델을 개발하겠다는 의지를 발표했습니다.
연구자들은 외부 감독 없이 모델의 자체 생성만 사용하여 대규모 언어 모델(LLM)의 사후 학습 성능을 향상시키는 방법인 비지도 온-폴리시 자기 증류(Unsupervised On-Policy Self-Distillation, U-OPSD)를 제안한다. 이 접근법은 다중 롤아웃을 샘플링하여 과반수 투표를 통해 의사 정답(pseudo-solution)을 구성한 후, 모델의 가장 긴 오답 완료 구문의 접두사 부분에 교사 분포를 증류(distill)한다.
Apple은 제3세대 파운데이션 모델(AFAM3)을 위한 새로운 아키텍처를 도입하여 "명령 따르기 가지치기"를 활용하여 활성 매개변수 수를 크게 줄였습니다. 이 모델은 토큰마다가 아닌 프롬프트당 한 번 라우팅 결정을 내림으로써 MLP 레이어의 약 20%를 활성화하도록 설계되었습니다.
NVIDIA의 NeMo 팀은 연구자들의 알고리즘 반복 작업을 단순화하기 위해 설계된 오픈소스 에이전트 강화 학습 프레임워크인 Molt를 출시했습니다. 이 코드베이스는 약 8.6K 줄의 RL 코드로 구성되어 있으며, verl(62K 줄)과 slime(25K 줄)과 같은 유사한 프레임워크에 비해 훨씬 작습니다.
저자는 잘못된 도구 선택이나 비정상적인 인수와 같은 실패한 도구 사용 에이전트 트레이스가 이러한 오류로부터 모델을 학습시키는 데 가치 있는 파인튜닝 데이터가 될 수 있다는 가설을 제시합니다. 이 게시물은 수정된 실패 트레이스에서의 학습이 효과적인지 해로운지에 대한 커뮤니티 피드백을 구합니다.
PIN 아키텍처 v2는 가중치 묶음을 사용하여 훈련 전에 신경망의 크기와 추론 속도를 사전에 선택하는 방법을 소개합니다. 이 기법은 셀 그룹이 동일한 값을 보유하도록 강제하여 네트워크가 너비를 유지하면서 저장된 가중치의 수를 극적으로 줄입니다.