연구자들은 오픈소스 코드베이스에 구현된 기능을 사용하여 소스 코드를 유일한 입력으로 강화학습 환경을 구축하는 에이전트 파이프라인인 CodeMidas를 소개했습니다. 이 방법은 기능 탐색, 실행 기반 테스트 구축, 반복 롤아웃을 통한 작업 검증을 위해 에이전트 컴퓨팅을 할당하며, 그 결과 23개 프로그래밍 언어에 걸쳐 5,545개의 학습 작업 데이터셋이 생성됩니다. GRPO를 사용하여 이러한 작업에서 MiMo-V2.5를 훈련하면 DeepSWE (+11.7%), ProgramBench (+17%), Terminal-Bench v2.1 (+8.5%) 등 다양한 벤치마크에서 성능이 향상됩니다. 궤적 분석에 따르면 RL로 훈련된 에이전트는 코드베이스 탐색 증가 및 더 다양한 자기 검증과 같은 더 나은 행동을 보이는 것으로 나타났습니다. 이러한 결과는 소스 코드가 다양한 소프트웨어 작업에서 코딩 에이전트를 개선하는 RL 환경을 구축하기 위한 확장 가능한 기반임을 입증합니다.
CodeMidas는 소스 코드를 사용하여 에이전트 코딩 RL 환경을 확장합니다
Atria Dawn 미리보기: 과학 연구를 위한 기반 에이전트 언어 모델
Atria Dawn Preview는 도구 매개 상호작용을 실행 가능 환경에 연결하는 검증 가능한 경험 파이프라인을 통해 학습된 과학 연구 및 엔지니어링 워크플로우를 위해 설계된 기반 에이전트 언어 모델입니다. 실제 연구, 엔지니어링 및 디지털 작업을 아우르는 16개 벤치마크에서 이 모델은 최첨단 에이전트들과 경쟁력 있으며, 그중 5개에서 최고 보고 점수를 달성했습니다.
NVIDIA Nemotron-3 모델이 IOI 2026에서 금메달 및 최고 인간 점수 달성
연구자들은 대규모 언어 모델이 프로그래밍 경시대회에서 금메달 수준의 성과를 낼 수 있도록 하는 사후 학습 파이프라인을 개발했습니다. 지도 미세 조정, 강화 학습, 그리고 GenCorrect라는 새로운 피드백 기반 전략을 결합함으로써 이 시스템은 IOI 2026 문제 세트에서 최고 인간 참가자들을 능가했습니다.
NVIDIA Nemotron-3 모델, IOI 코딩 대회에서 금메달급 성능 달성
NVIDIA는 경쟁 프로그래밍에서 뛰어난 성과를 거두기 위해 Nemotron-3-Nano-CC 및 Nemotron-3-Ultra-CC 언어 모델용 사후 학습 파이프라인을 개발했습니다. 대규모 문제 큐레이션, 합성 추론 트레이스, 지도 미세 조정(SFT) 및 강화 학습(RL)을 결합하여 팀은 고급 알고리즘적 추론이 가능한 전문 시스템을 구축했습니다.
NVIDIA의 Nemotron-3 모델이 IOI 코딩 대회에서 금메달급 성능 달성
NVIDIA는 Nemotron-3 언어 모델용 사후 학습 파이프라인을 개발하여 국제정보올림피아드(IOI)에서 금메달 수준의 성능을 달성했습니다. 이 접근법은 대규모 문제 큐레이션, 합성 추론 트레이스, 지도 미세 조정 및 강화 학습을 결합합니다.
JIT-Agent는 에이전트 LLM 성능 향상을 위한 실시간 하니스 진화를 가능하게 한다
저자들은 JIT-Agent를 제시하는데, 이는 임의의 범용 에이전트 LLM을 위해 작업 적응형 에이전트 하니스를 생성하도록 훈련된 하이너스 인텔리전스 모델이다. 이 접근법은 에이전트 하이너스를 고정된 4개 모듈 프로토콜에 의해 지배되는 조합 가능한 아티팩트로 공식화하여, 시스템이 하이너스를 실시간으로 사용자 지정하고 수리할 수 있게 한다.