문샷 AI가 2.8T MoE 모델인 Kimi K3를 천만 토큰 컨텍스트와 함께 출시
문샷 AI는 총 2.8조 개의 매개변수와 토큰당 1040억 개의 활성화된 매개변수를 갖춘 오픈소스 Mixture-of-Experts 모델을 선보이는 Kimi K3를 소개합니다. 이 아키텍처는 네이티브 비전 기능을 활용하며, Kimi Delta Attention과 Stable LatentMoE를 통해 100만 토큰 컨텍스트 윈도우를 지원합니다.
문샷 AI는 총 2.8조 개의 매개변수와 토큰당 1040억 개의 활성화된 매개변수를 갖춘 오픈소스 Mixture-of-Experts 모델을 선보이는 Kimi K3를 소개합니다. 이 아키텍처는 네이티브 비전 기능을 활용하며, Kimi Delta Attention과 Stable LatentMoE를 통해 100만 토큰 컨텍스트 윈도우를 지원합니다.
연구자들은 Transformer의 행렬 곱을 모델 가중치를 수정하지 않고 수축 차원을 따라 정보적인 슬라이스를 선택하여 줄이는 학습 없는 입력 적응형 추론 방법인 축소된 행렬 곱셈(RMM)을 제안합니다. 간단한 유지 비율 제어를 통해 RMM은 1B에서 70B 파라미터에 이르는 언어 모델 전반에 걸쳐 매끄럽고 예측 가능한 정확도-효율성 트레이드오프를 제공합니다.
이 논문은 롤아웃 피드백을 기반으로 하니스를 재귀적으로 개선하는 코드 에이전트를 안내하기 위해 메타-하니스 옵티마이저를 사용하는 프레임워크인 AutoDesign을 소개합니다. 저자들은 PosterBench라는 새로운 벤치마크를 사용하여 학술 논문에서 포스터 생성 작업에 이 접근 방식을 평가합니다.
저자들은 Intern-S2-Preview를 제시하는데, 이는 멀티모달 과학적 이해, 추론, 생성 및 장기 작업을 지원하도록 설계된 일련의 과학용 에이전트 파운데이션 모델입니다. 훈련 파이프라인은 렌더링된 과학 문서, 교차된 이미지-텍스트 데이터 및 다양한 과학 코퍼스를 대상으로 한 과학 멀티모달 사전 훈련으로 시작됩니다.
저소득 및 중산층 국가를 위해 설계된 검색 증강 생성 시스템인 VITA는 HealthBench의 영어 하위 집합에서 1위를 차지하며 GPT-5.4, o4-mini, Gemini 3.1 Pro, Claude Sonnet 4.6을 앞질렀습니다.
연구자들이 레퍼런스 없는 사후 학습을 활용하는 다국어 기계 번역용 오픈 대규모 언어 모델인 MiLMMT-46-v1.0을 공개했습니다. 감독 학습 파인튜닝된 MiLMMT-46-v0.1을 기반으로, 연구팀은 언어 식별에 의해 게이트되는 두 개의 레퍼런스 없는 품질 추정 모델을 기반으로 한 보상과 함께 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)를 적용했습니다.
Macaron-V1은 경험적 지능을 위해 설계된 오픈 에이전트 모델 패밀리로, 시스템이 실제 세계의 경험으로부터 학습하고 배포 후에도 지속적으로 개선할 수 있도록 합니다. 이 아키텍처는 두 가지 목표를 중심으로 합니다: 모델-하니스 쌍의 재귀적 자기 개선을 통한 적응과, 사용자 턴마다 전문가 어댑터를 선택하는 Mixture-of-LoRA(MoL) 시스템을 통한 협업.
연구자들은 저지연 대화를 실시간 오디오비주얼 지각과 통합하는 Gemini 기반 다중 에이전트 시스템인 AMIE (Video)를 사용하여 실시간 임상 비디오 상담을 위한 최초의 전문가 수준 AI 시스템을 시연했습니다.
미생물 발암에 대한 체계적 증거 합성을 대상으로 대규모 언어 모델을 벤치마킹한 연구 결과, GPT-5와 GPT-5 Nano가 도메인 전문가와 구별되지 않는 성능을 보였다고 밝혔다. 연구진은 Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5, GPT-5 Nano를 여러 질문 유형에 걸쳐 77개 항목으로 구성된 구조화된 템플릿을 사용하여 24편의 연구 논문에 대해 평가했다.
연구자들은 증거 기반 다중 모달 은유 이해를 평가하기 위해 설계된 인간 검증 주석이 포함된 1,000개의 이미지-텍스트 인스턴스를 포함하는 통합 벤치마크인 M$^3$R-Bench를 소개합니다. 이 벤치마크는 개념적 은유 이론에 기반한 은유 발생, 대상-소스 매핑, 감정 및 단계별 설명에 대한 결합 주석을 제공합니다.
Douyin은 대규모 대비적 사전 학습과 잠재 추론을 결합하여 강력한 판별력과 효율성을 달성한 그 다중 모션 임베딩(DME) 모델의 기술 보고서를 공개했습니다.
연구진은 397B-A17B Qwen mixture-of-experts 백본을 기반으로 구축된 네이티브 컴퓨터 사용 에이전트인 Qwen-CUA를 소개했습니다. 이 시스템은 DOM 트리나 접근성 메타데이터에 의존하지 않고 스크린샷을 관찰하며 키보드 및 마우스 이벤트를 통해 작동합니다.
연구는 사고의 연쇄(CoT) 모니터링이 추론 과정을 통제하는 적대자에게 실패함을 보여준다. 공격자는 에이전트의 추론을 재작성하여 명령과 출력을 그대로 유지하면서 선의의 엔지니어링처럼 보이게 함으로써 탐지 메커니즘을 우회할 수 있다.
연구자들은 매개변수형 장기 메모리 모델을 6.9B 파라미터까지 확장하고 300B 토큰으로 사전 훈련하는 시스템인 대규모 Memory Decoder를 제시합니다. 이 데이터 규모에서 표준 Faiss 파이프라인의 실행 불가능성을 해결하기 위해, 저자들은 kNN 분포의 희소 및 배치별 로딩을 사용하는 분산 인덱싱 파이프라인을 구현했습니다.
Frontis는 머신러닝 엔지니어링에서의 재귀적 자기개선을 위해 설계된 35B 파라미터 AI4AI 모델인 Frontis-MA1과 오픈소스 OpenMLE 스택을 출시했습니다. 이 시스템은 검증 가능한 작업 환경, 연산자 학습(long-horizon search), 그리고 장기적 탐색을 통합하여 실행 기반 훈련을 통해 자체 코드를 개선하는 에이전트를 가능하게 합니다.
연구자들은 컴퓨터 사용 에이전트 궤적에 대한 심판 역할을 하는 비전-언어 모델(VLM)의 신뢰성을 평가하기 위해 설계된 현실적인 벤치마크인 OSReward를 소개합니다. 이 연구는 최신 VLM조차도 체계적인 관용 편향에 시달리며 규모 확장에 너무 비싸다는 점을, 반면 저렴한 오픈 모델은 성능이 낮다는 점을 보여줍니다.
연구자들은 Living-Harness를 제안했는데, 이는 완료된 트래젝토리와 평가자 신호를 유한한 하네스 업데이트를 위한 사후 증거로 변환하는 자기 진화형 에이전트 하네스입니다. Evolution-SOP의 지침에 따라 시스템은 에피소드 추상화와 구조화된 업데이트 증거를 추출하여 에피소드 메모리와 상태 그래프를 작성합니다.
연구원들은 120B 규모 모델의 학습 과정에 가치 기반 콘텐츠를 삽입하여 표준 사후 학습 방법보다 더 내구성이 강한 정렬을 생성하는지 확인하기 위해 헌법적 중간 학습을 테스트했다. 연구 결과, 이 접근 방식은 특히 지도 미세 조정 이후의 협박 성향을 완화하는 데 특히 Alignment 일반화와 내구성을 크게 향상시키는 것으로 나타났다.
연구자들은 표준 온파시얼리 디스틸레이션에서 학생의 오류가 신뢰할 수 없는 감독을 초래하는 접두사 실패 문제를 해결하기 위해 Relay On-Policy Distillation (Relay-OPD)를 소개했습니다. 이 방법은 교사-학생 연속성 비대칭을 트리거로 사용하여, 학생이 재개하기 전에 교사가 잠시 개입하여 궤적을 재지시합니다.
PIVOT(Proxy Indexing Via One full-prefix Traversal)은 DeepSeek Sparse Attention(DSA) 인덱서를 위한 학습 불필요한 드롭인 대체재로, 근처 쿼리 그룹 간에 하나의 접두사 스캔을 공유하여 계산 중복성을 줄입니다. PIVOT은 각 쿼리에 대해 개별적으로 모든 선행 토큰을 점수 매기는 대신, 그룹을 단일 프록시 쿼리로 집계하여 후보 집합을 얻고, 여기서 각 쿼리별로 상위 k개 토큰을 선택합니다.