NVIDIA Nemotron-3 모델이 IOI 2026에서 금메달 및 최고 인간 점수 달성
연구자들은 대규모 언어 모델이 프로그래밍 경시대회에서 금메달 수준의 성과를 낼 수 있도록 하는 사후 학습 파이프라인을 개발했습니다. 지도 미세 조정, 강화 학습, 그리고 GenCorrect라는 새로운 피드백 기반 전략을 결합함으로써 이 시스템은 IOI 2026 문제 세트에서 최고 인간 참가자들을 능가했습니다.
연구자들은 대규모 언어 모델이 프로그래밍 경시대회에서 금메달 수준의 성과를 낼 수 있도록 하는 사후 학습 파이프라인을 개발했습니다. 지도 미세 조정, 강화 학습, 그리고 GenCorrect라는 새로운 피드백 기반 전략을 결합함으로써 이 시스템은 IOI 2026 문제 세트에서 최고 인간 참가자들을 능가했습니다.
연구자들은 파이프라인을 전문화된 모듈로 분리하여 복잡한 작업을 위한 고품질 자연어 실행 계획을 생성하도록 설계된 전략 인식형 다단계 계획 프레임워크인 GRASP를 소개합니다. 이 시스템은 GenPlan을 통해 글로벌 매크로 가이드라인을 사전 컴파일하고, RevPlan을 통해 지역화 전략을 탐색하며, VerPlan이라는 다중 기준 판별기를 사용하여 궤적을 평가합니다.
연구자들은 최첨단 AI 연구 에이전트의 자체 코드를 최적화하여 재귀적 자기 개선 루프를 구현하는 시스템인 AIDE^2를 제시했습니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, AI R&D 작업에서 수정된 버전을 벤치마킹하며, 숨겨진 평가에서 가장 우수한 성능을 보이는 업데이트만 유지합니다.
연구원들은 수백만 개의 토큰을 처리하는 에이전트를 위해 설계된 자동 압축 기법인 CliffCompaction을 소개했으며, 이는 제한된 컨텍스트 하에서 비용을 최대 50%까지 절감합니다. 이 방법은 Terminal-Bench에서 성능을 유지하거나 향상시키며, 재표현이 아닌 잘라내기를 통해 정보를 정확하게 유지함으로써 KernelBench에서 최첨단 결과를 달성했습니다.
저자들은 진단 및 임상 의료 추론을 향상시키기 위해 합성 데이터와 기준 기반 강화 학습을 사용하는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문들에 규칙 유도 RL을 적용한 후, 상호작용 임상 작업을 위해 다차원 기준과 함께 5.3k 합성 멀티 턴 시나리오를 활용합니다.
OpenAI는 학습 중 모든 연산이 이종 상용 하드웨어에서 비트 단위의 정확도로 독립적으로 재현 가능한 체계 하에 훈련된 언어 모델인 Open-1B를 출시했습니다. 이 접근 방식은 GPU 커널 축소 및 데이터 배치 순서화와 같은 비결정론적 원인에 명확한 순서를 부과함으로써 오픈소스 모델에 내재된 재현성 문제를 해결합니다.
저자들은 Stellar Colosseum을 소개합니다. 이는 수학 및 이론 컴퓨터 과학 분야의 장기 연구에 추론을 할당하도록 설계된 모델 비종속 하니스입니다. 이 시스템은 증명 구성 전에 대체 전략을 탐색하고, 준비 게이트를 사용하여 경로가 분해에 충분히 성숙한 시점을 결정하며, 증명 계획을 상호의존적인 섹션 수준의 하위 문제로 표현합니다.
Vidu S2에는 실시간 대화형 디지털 캐릭터 모델인 Vidu S2-Avatar와 실시간 비디오 편집 모델인 Vidu S2-Editing이 포함됩니다. 이 시스템은 두 구성 요소 모두에 대한 실시간 공간 비디오 생성의 실현 가능성도 탐구합니다.
연구자들은 단일 소비자 GPU에서 스트리밍 추론을 가능하게 하면서 자연스러운 운율을 보존하는 텍스트 음성 변환 모델인 TontaubeV1을 제시했습니다. 이 시스템은 의미 있는 스트림과 음향적 정제를 분리하기 위해 12.5 Hz의 계층적 DualCodec 표현을 사용하며, 이를 통해 낮은 지연 시간 생성이 가능합니다.
저자들은 Speculative Uncertainty(SU)라는 기술을 제시합니다. 이 기술은 로짓, 가중치 또는 활성화에 대한 접근 없이 출력 토큰만 분석하여 블랙박스 LLM 에이전트의 예측 실패 신호를 복원합니다. 추측적 디코딩을 역전환하여 작은 오픈 가중치 초안 모델이 단 한 번의 순전파로 에이전트의 궤적을 점수화하여 위상 인식 특징을 추출하고 검증 가능한 목표와 대조하여 보정합니다.
FlashAttention-4는 비원인적(noncausal) 추론과 인과적(causal) 학습을 위한 새로운 경로를 도입하여 Blackwell의 4비트 부동소수점(FP4) 텐서 코어의 성능 한계를 해결합니다. Direct-P라고 불리는 이 방법은 행렬 곱이 축소됨에 따라 지배적이 되는 소프트맥스 변환 오버헤드를 우회하기 위해 점수를 직접 FP4 확률로 매핑합니다.
해당 논문은 CANOPY(Coverage-ANchored On-PolicY RL)라는 프로토콜을 소개하며, 이는 작은 오픈 모델의 장기적 강화 학습에서 신호 기아와 정책 드리프트 문제를 해결합니다. 동일한 작업에 대한 탐색을 확장하고 업데이트를 KL-anchored로 유지함으로써 이 방법은 에이전트가 작업 종료 시 검증 정보만으로 효과적으로 학습할 수 있게 합니다.