研究者らは、オープンソースのコードベースに実装された機能を用いて、ソースコードを唯一の入力として強化学習環境を構築するエージェントパイプライン「CodeMidas」を紹介した。 本手法は、エージェント計算資源を割り当てて機能を探索し、実行に根ざしたテストを構築し、反復ロールアウトを通じてタスクを検証することで、23のプログラミング言語にわたる5,545件のトレーニングデータセットを生成する。 これらのタスクでGRPOを用いてMiMo-V2.5を訓練すると、DeepSWE (+11.7%)、ProgramBench (+17%)、Terminal-Bench v2.1 (+8.5%) など5つの多様なベンチマークでパフォーマンスが向上した。 軌跡分析により、RLで訓練されたエージェントは、コードベースの探索増加やより多様な自己検証など、より優れた行動を示すことが示唆された。 これらの結果は、多様なソフトウェアタスクにおけるコーディングエージェントを改善するRL環境を構築するためのスケーラブルな基盤として、ソースコードを確立するものである。
CodeMidasはソースコードを使用してエージェント型コーディングRL環境をスケーリング
Atria Dawn プレビュー: 科学的研究のための基盤エージェント型言語モデル
Atria Dawn Preview は、科学的研究およびエンジニアリングワークフローのために設計された基盤エージェント型言語モデルであり、ツールを介した相互作用を実行可能環境に接続する検証可能な経験パイプラインを通じてトレーニングされています。現実の研究、エンジニアリング、デジタル作業にわたる16のベンチマークにおいて、このモデルは最先端のエージェントと競争力があり、そのうち5つで最高の報告スコアを達成しています。
NVIDIA Nemotron-3 モデルが IOI 2026 で金メダル級およびトップ人間スコアを達成
研究者らは、大規模言語モデルが競技プログラミングで金メダル級の性能を発揮できるようにするポストトレーニングパイプラインを開発した。教師ありファインチューニング、強化学習、そして GenCorrect と呼ばれる新しいフィードバック駆動型戦略を組み合わせることで、このシステムは IOI 2026 の問題セットにおいてトップの人間出場者を上回る性能を示した。
NVIDIA Nemotron-3モデルがIOIプログラミング競技で金メダル級の性能を達成
NVIDIAは、競合プログラミングにおいて卓越したパフォーマンスを発揮するため、Nemotron-3-Nano-CCおよびNemotron-3-Ultra-CC言語モデル向けのポストトレーニングパイプラインを開発した。大規模な問題キュレーション、合成推論トレース、教師ありファインチューニング、強化学習を組み合わせることで、チームは高度なアルゴリズム的推論能力を持つ専門システムを作成した。
NVIDIAのNemotron-3モデルがIOIプログラミング競技で金メダル級の性能を達成
NVIDIAは、そのNemotron-3言語モデル向けのポストトレーニングパイプラインを開発し、国際情報オリンピック(IOI)で金メダル級の性能を実現可能にした。このアプローチは、大規模な問題キュレーション、合成推論トレース、教師ありファインチューニング、強化学習を組み合わせたものである。
JIT-Agentがオンザフライのハーン進化によりエージェント型LLMのパフォーマンスを向上
著者らは、任意の市販のエージェント型LLMに対してタスク適応型のエージェントハーンを合成するように訓練されたハーンインテリジェンスモデルであるJIT-Agentを発表する。このアプローチは、エージェントハーンを固定された4モジュールプロトコルによって制御される組み合わせ可能なアーティファクトとして形式化し、システムがハーンをオンザフライでカスタマイズおよび修復できるようにする。