출처 · arXiv cs.LG
arxiv arXiv cs.LG · 18일 전 · 조회수 3회

문샷 AI가 2.8T 파라미터 MoE 모델인 Kimi K3를 출시, 백만 토큰 컨텍스트 지원

문샷 AI는 총 2.8조 개의 파라미터와 토큰당 1040억 개의 활성화된 파라미터를 갖춘 오픈소스 Mixture-of-Experts 모델을 선보인 Kimi K3를 소개했습니다. 이 모델은 Kimi Delta Attention과 Stable LatentMoE를 활용하여 전작인 Kimi K2 대비 약 2.5배의 확장 효율성을 달성하며 네이티브 비전 기능과 100만 토큰 컨텍스트 윈도우를 지원합니다.

arxiv arXiv cs.LG · 16시간 전

Intern-S2-Preview: 과학적 에이전트 파운데이션 모델

저자들은 다중 모달 과학적 이해, 추론, 생성 및 장기 작업을 지원하도록 설계된 일련의 과학적 에이전트 파운데이션 모델인 Intern-S2-Preview를 제시합니다. 학습 파이프라인은 렌더링된 과학 문서, 교차된 이미지-텍스트 데이터 및 다양한 과학 코퍼스에 대한 과학적 다중 모달 사전 훈련을 시작으로 합니다.

arxiv arXiv cs.LG · 2일 전 HealthBench · 51.9% · 조회수 5회

VITA 임상 RAG 시스템이 HealthBench에서 최전방 LLM과 동등하거나 우수함

저소득 및 중소득 환경을 위해 설계된 전용 검색 증강 생성(RAG) 시스템인 VITA가 HealthBench 벤치마크에서 범용 대규모 언어 모델에 대해 평가되었습니다. GPT-4.1 심판이 채점한 4,023개의 질문에 대해 VITA는 가능한 루브릭 포인트의 51.9%를 획득하여 1위를 차지했으며, GPT-5.4, o4-mini, Gemini 3.1 Pro 및 Claude Sonnet 4.6을 앞질렀습니다.

arxiv arXiv cs.LG · 4일 전 · 조회수 2회

Macaron-V1이 Mixture-of-LoRA를 활용한 지속 학습용 오픈 에이전트 모델 패밀리 출시

Macaron-V1은 실제 환경에서 학습하고 배포 후에도 학습을 계속할 수 있도록 설계된 경험적 지능용 오픈 에이전트 모델 패밀리입니다. 이 시스템은 두 가지 목표에 중점을 둡니다: 모델-하arness 쌍의 재귀적 개선을 통한 적응과, 사용자 턴마다 전문가 LoRA 어댑터를 선택하는 Mixture-of-LoRA (MoL) 아키텍처를 통한 협업.

arxiv arXiv cs.LG · 4일 전 · 조회수 11회

연구자들이 세션 간 암호화 재사용을 악용하여 LLM API에서 추론 추적을 탈취

연구자들은 주요 대규모 언어 모델 제공업체들이 클라이언트 측 사용을 위해 암호화된 블록으로 반환하는 단계별 추론 추적을 처리하는 방식에서 취약점을 발견했습니다. 그들은 이러한 암호화된 블록이 동일한 제공업체의 생태계 내의 서로 다른 세션, 사용자 및 모델 간에 완전히 호환되고 교체 가능함을 확인했습니다.

arxiv arXiv cs.LG · 8일 전

U-OPSD는 LLM을 위한 비지도 온-폴리시 자기 증류(Self-Distillation)를 가능하게 한다

연구자들은 외부 감독 없이 모델의 자체 생성만 사용하여 대규모 언어 모델(LLM)의 사후 학습 성능을 향상시키는 방법인 비지도 온-폴리시 자기 증류(Unsupervised On-Policy Self-Distillation, U-OPSD)를 제안한다. 이 접근법은 다중 롤아웃을 샘플링하여 과반수 투표를 통해 의사 정답(pseudo-solution)을 구성한 후, 모델의 가장 긴 오답 완료 구문의 접두사 부분에 교사 분포를 증류(distill)한다.

arxiv arXiv cs.LG · 11일 전 OSWorld 2.0 · 21.2% · 조회수 20회

Qwen, 397B-A17B 네이티브 컴퓨터 사용 에이전트 Qwen-CUA 출시

Qwen은 DOM 트rees나 접근성 메타데이터에 의존하지 않고 스크린샷과 입력 이벤트를 통해 작동하는 397B-A17B mixture-of-experts 백본을 기반으로 구축된 네이티브 컴퓨터 사용 에이전트인 Qwen-CUA를 소개합니다. 이 시스템은 최대 20개의 활성 스크린샷을 유지하기 위한 스캐폴드를 활용하며, 약 40,000개의 검증 가능한 작업에 걸쳐 거의 100,000개의 vCPU를 갖춘 클라우드 롤아웃 플릿을 사용하여 훈련되었습니다.

arxiv arXiv cs.LG · 24일 전 · 조회수 8회

SkewAdam은 다단계 옵티마이저 상태를 사용하여 MoE 학습 메모리를 97% 절감

연구자들은 SkewAdam을 소개했는데, 이는 전문가 혼합(MoE) 모델을 위해 설계된 옵티마이저로, 서로 다른 매개변수 집단에 서로 다른 상태 유형을 할당하여 메모리 사용을 극적으로 줄입니다. SkewAdam은 백본에는 float32 모멘텀과 분할된 2차 모멘트를, 전문가에는 분할된 2차 모멘트를, 라우터에는 정확한 2차 모멘트를 할당함으로써 6.78B 매개변수 모델에 대해 옵티마이저 상태를 50.6 GB에서 1.29 GB로 줄입니다.

arxiv arXiv cs.LG · 28일 전 · 조회수 2회

RoboTTT는 로봇 정책의 컨텍스트를 8K 타임스텝으로 확장합니다

연구자들은 시각운동 컨텍스트를 추론 지연 시간 증가 없이 8,000 타임스텝까지 확장하는 로봇 파운데이션 모델을 위한 학습 레시피인 RoboTTT를 소개합니다. 이 방법은 훈련 및 추론 모두에서 경사 하강법을 통해 업데이트되는 빠른 가중치를 사용하여 Vision-Language-Action 정책에 테스트 타임 트레이닝을 통합합니다.