Peneliti memperkenalkan CodeMidas, sebuah pipeline agentic yang membangun lingkungan pembelajaran penguatan dari fungsionalitas yang diimplementasikan dalam basis kode open-source, dengan menggunakan kode sumber sebagai satu-satunya input. Metode ini mengalokasikan komputasi agentic untuk mengeksplorasi fungsionalitas, membangun tes berbasis eksekusi, dan memvalidasi tugas melalui rollouts berulang, menghasilkan dataset berisi 5.545 tugas pelatihan di 23 bahasa pemrograman. Pelatihan MiMo-V2.5 pada tugas-tugas ini dengan GRPO meningkatkan kinerja pada lima benchmark beragam, termasuk DeepSWE (+11,7%), ProgramBench (+17%), dan Terminal-Bench v2.1 (+8,5%). Analisis trajektori menunjukkan bahwa agen yang dilatih dengan RL menampilkan perilaku yang lebih baik seperti eksplorasi basis kode yang lebih besar dan verifikasi diri yang lebih beragam. Hasil-hasil ini menetapkan kode sumber sebagai fondasi yang dapat diskalakan untuk membangun lingkungan RL yang meningkatkan agen pemrograman di berbagai tugas perangkat lunak.
CodeMidas menskalakan lingkungan RL pemrograman agentic menggunakan kode sumber
Pratinjau Atria Dawn: model bahasa agentic dasar untuk penelitian ilmiah
Atria Dawn Preview adalah model bahasa agentic dasar yang dirancang untuk alur kerja penelitian ilmiah dan teknik, dilatih melalui Pipelina Pengalaman Terverifikasi yang menghubungkan interaksi yang dimediasi alat ke lingkungan yang dapat dieksekusi. Di seluruh 16 benchmark yang mencakup penelitian dunia nyata, teknik, dan pekerjaan digital, model ini kompetitif dengan agen terdepan dan mencapai skor tertinggi yang dilaporkan pada lima di antaranya.
Model Nemotron-3 dari NVIDIA meraih skor emas dan skor di atas manusia dalam IOI 2026
Para peneliti telah mengembangkan pipeline pasca-pelatihan untuk model bahasa besar yang memungkinkan mereka mencapai kinerja tingkat medali emas dalam pemrograman kompetitif. Dengan menggabungkan penyetelan halus terawasi, pembelajaran penguatan, dan strategi baru berbasis umpan balik bernama GenCorrect, sistem ini mengungguli para kontestan manusia terbaik pada kumpulan soal IOI 2026.
Model Nemotron-3 NVIDIA meraih kinerja medali emas dalam kompetisi coding IOI
NVIDIA telah mengembangkan pipeline pasca-pelatihan untuk model bahasa Nemotron-3-Nano-CC dan Nemotron-3-Ultra-CC-nya agar unggul dalam pemrograman kompetitif. Dengan menggabungkan kurasi masalah skala besar, jejak penalaran sintetis, penyetelan halus terawasi (supervised fine-tuning), dan pembelajaran penguatan, tim tersebut menciptakan sistem khusus yang mampu melakukan penalaran algoritmik tingkat tinggi.
Model Nemotron-3 NVIDIA mencapai kinerja medali emas dalam kompetisi pemrograman IOI
NVIDIA telah mengembangkan pipa pasca-pelatihan untuk model bahasa Nemotron-3-nya, memungkinkan mereka mencapai kinerja tingkat medali emas di Olimpiade Informatika Internasional (IOI). Pendekatan ini menggabungkan kurasi masalah skala besar, jejak penalaran sintetis, penyetelan halus terawasi, dan pembelajaran penguatan.
JIT-Agent memungkinkan evolusi harness secara langsung untuk meningkatkan kinerja LLM agentic
Para penulis menyajikan JIT-Agent, sebuah model kecerdasan harness yang dilatih untuk mensintesis harness agen yang adaptif terhadap tugas untuk berbagai LLM agentic siap pakai. Pendekatan ini memformalkan harness agen sebagai artefak komposabel yang diatur oleh protokol empat modul tetap, memungkinkan sistem menyesuaikan dan memperbaiki harness secara langsung.