NVIDIA Nemotron-3 모델, IOI 코딩 대회에서 금메달급 성능 달성
NVIDIA는 경쟁 프로그래밍에서 뛰어난 성과를 거두기 위해 Nemotron-3-Nano-CC 및 Nemotron-3-Ultra-CC 언어 모델용 사후 학습 파이프라인을 개발했습니다. 대규모 문제 큐레이션, 합성 추론 트레이스, 지도 미세 조정(SFT) 및 강화 학습(RL)을 결합하여 팀은 고급 알고리즘적 추론이 가능한 전문 시스템을 구축했습니다.
NVIDIA는 경쟁 프로그래밍에서 뛰어난 성과를 거두기 위해 Nemotron-3-Nano-CC 및 Nemotron-3-Ultra-CC 언어 모델용 사후 학습 파이프라인을 개발했습니다. 대규모 문제 큐레이션, 합성 추론 트레이스, 지도 미세 조정(SFT) 및 강화 학습(RL)을 결합하여 팀은 고급 알고리즘적 추론이 가능한 전문 시스템을 구축했습니다.
연구자들은 컨텍스트 언어 모델(CLMs)을 소개했는데, 이는 모델의 컨텍스트 창을 편집 가능한 파일로 취급하여 모델이 자신의 메모리에 제한 없이 업데이트할 수 있도록 하는 새로운 아키텍처입니다. 이 접근 방식은 컨텍스트 관리를 외부 하네시 제어에서 모델의 내재적 행동으로 전환하여, 컨텍스트 내 학습과 매개변수 학습 모두를 통해 컨텍스트 관리 전략을 가능하게 합니다.
"Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation"라는 제목의 연구는 대화 기록에 주입된 거짓 전제를 대형 언어 모델이 어떻게 처리하는지 평가하며, 이는 세션 레벨 오염이라는 실패 모드로 명명됩니다. 연구자들은 GPT-5.4 Mini, Gemini-3.1 Flash-Lite, GLM-4.5-Air를 22,500 턴의 온도 제로 조건으로 열 가지 지식 도메인에서 테스트했습니다.
연구자들은 Retrospection-Only Fine-Tuning (ROFT)를 조사하고 있습니다. 이는 에이전트가 자신의 경험에 대한 회고적 설명을 생성하고 해당 설명 토큰의 다음 토큰 예측 손실만을 사용하여 파인튜닝되는 최소한의 온라인 절차입니다. 이 방법에는 외부 교사나 보상 기반 정책 업데이트가 필요하지 않습니다.
연구원들은 Chain-of-Thought 추론의 높은 토큰 소비를 추론 궤적 내 토큰의 비균일한 가치를 활용하여 해결하는 프레임워크인 TokenProbe를 제시했습니다. 이 방법은 정규화된 로그 확률 신호를 사용하여 결정적인 내용을 담고 있는 핵심 토큰과 중복된 필러를 구분합니다.
연구자들은 Visual Answerability Diagnosis with Rationales(VAD-R)이라는 새로운 벤치마크를 소개했으며, 이는 단서 없이 답할 수 없는 질문에 대해 기권하는 능력과 관련된 시각-언어 모델의 성능을 평가하기 위해 설계되었습니다. 연구 결과, 은닉 상태가 답변 가능성을 구분할 수는 있지만 현재 모델들은 이를 명시적인 결정으로 전환하지 못하는 것으로 드러났습니다.
연구자들은 질문 관련 증거를 식별하고 답변을 생성하기 전에 이를 압축된 요약에 통합하는 압축 후 추론 패러다임인 Highlight-Then-Summarize(H2S)를 제안했다. 이 접근 방식을 지원하기 위해 연구진은 11개 벤치마크 패밀리에서 6,647개의 예제를 포함한 H2S-Dataset을 구축하고 프로세스 수준 보상을 위한 H2S-RL을 도입했다.
연구자들은 "오래된 문서 오염"을 확인했는데, 이는 Retrieval-Augmented Generation (RAG)에서의 시간 정렬 실패로, 오래된 외부 증거가 모델을 올바른 응답을 알고 있음에도 불구하고 잘못된 답변을 제공하게 만든다.
Tencent는 원시 사용자 기록을 대화 에이전트 및 추천 시스템용 컴팩트한 표현으로 압축하는 통합 행동 압축 레이어인 KuaFu를 소개했습니다. 이 시스템은 2축 프로젝터를 사용하여 각 행동 항목을 너비 128-256의 2-4개 토큰으로 압축하여 수십억 사용자의 긴 시퀀스 처리 병목을 해결합니다.
도구 사용 에이전트를 위한 새로운 코루틴-브리지 하니스가 CAR-bench 평가의 트랙 2를 우승했으며, 공식 숨겨진 테스트 세트에서 60.0%의 Pass@3 점수를 달성했습니다. 이 시스템은 모델이 평가자 간 교환을 가로질러 차단하고 재개하는 Python 프로그램을 생성하도록 함으로써 모델 호출과 도구 왕복을 분리합니다.
연구자들은 매우 큰 컨텍스트의 효과적인 표현을 구축하기 위해 인지 이론 원칙을 운영화하는 하네스인 R3Con을 제안합니다. 이 시스템은 표준 모델 컨텍스트 제한을 넘어 방대한 소스에 흩어진 상호 의존 정보를 조립하는 과제를 해결합니다.
VHD-Play는 수학적 모델을 샘플링하고 해결한 후 의사결정 과정을 상태 유지 도구로 렌더링하여 다양한 에이전트형 강화학습 환경을 생성하는 파이프라인입니다. 이 접근 방식은 실행 가능한 동역학과 궤적 평가 기준이 해결된 모델에서 직접 상속되도록 하여 기존 생성 파이프라인에서 흔히 발생하는 정렬 문제를 해결합니다.
저자들은 WebMRE를 소개한다. 이는 성공적인 WebArena 트래젝토리에서 파생된 541개의 작업과 5,293개의 스텝으로 구성된 오프라인 벤치마크로, 환경 드리프트 없이 웹 에이전트 체크포인트를 평가하기 위한 결정론적 프로토콜을 제공하도록 설계되었다. 이 프레임워크는 인간 중심의 가이드 문장과 지상화된 액션을 짝지어 두 요소 간 상호 보강 효과를 연구한다.
연구진은 SkillGym을 소개합니다. 이는 인간이 작성한 에이전트 기술을 대형 언어 모델 에이전트를 위한 실행 가능하고 검증 가능한 학습 환경으로 변환하는 프레임워크입니다. 이 시스템은 기술-작업 파이프라인을 활용하여 구체적인 작업을 인스턴스화하고 코드 기반 체크기로 결과를 검증합니다.
연구자들은 중앙 오케스트레이터 병목을 제거하고 동시 작업자가 하위 작업을 비동기적으로 주장하며 진행을 병합할 수 있도록 하는 확장 가능한 자기 조직화 멀티에이전트 하네스인 Agensh를 소개했습니다.
연구자들은 표준, 구성 및 로그에 대한 추론을 통해 엔지니어링 작업을 자동화하도록 설계된 오픈소스 통합 telecom 추론 모델 패밀리인 TelecomGPT-R1을 소개합니다. 이 모델은 프로토콜, 지식, 모델링, 결함 축을 아우르는 구조화된 접근 방식을 통해 기존 범용 및 전문 LLM의 한계를 극복합니다.
Alibaba Cloud는 이전 오미 모델에 비해 멀티모달 이해와 추론을 크게 향상시키는 실세계 생산성 작업을 위해 설계된 네이티브 멀티모달 에이전트 모델인 Qwen3.8-Omni-Flash를 소개했습니다.
저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다.
연구자들은 AgentRouter를 제안했는데, 이는 단일 최첨단 모델을 모든 작업에 사용하는 대신 개별 궤적 단계를 적절한 모델 계층으로 라우팅하여 다단계 에이전트 워크플로우를 최적화하는 경량 분류기입니다. 이 시스템은 더 작은 모델로도 충분히 처리할 수 있는 하위 작업에 추론 예산의 60-80%를 낭비하는 기업 시스템의 비효율성을 해결합니다.
NemotronLabs는 듣기, 전사, 추론, 발화를 통합된 스트리밍 아키텍처 내에서 결합하도록 설계된 오픈 가중치 풀듀플렉스 음성-음성 모델인 VoiceChat을 출시했습니다. 이 시스템은 스트리밍 음성 인코더와 디코더 전용 언어 모델을 결합하여 에이전트 텍스트 및 구조화된 함수 호출을 위한 병렬 특수화 출력 스트림과 증분 사용자 전사를 위한 보조 RNN-T 브랜치를 제공합니다.