NVIDIA Nemotron-3モデルがIOIプログラミング競技で金メダル級の性能を達成
NVIDIAは、競合プログラミングにおいて卓越したパフォーマンスを発揮するため、Nemotron-3-Nano-CCおよびNemotron-3-Ultra-CC言語モデル向けのポストトレーニングパイプラインを開発した。大規模な問題キュレーション、合成推論トレース、教師ありファインチューニング、強化学習を組み合わせることで、チームは高度なアルゴリズム的推論能力を持つ専門システムを作成した。
NVIDIAは、競合プログラミングにおいて卓越したパフォーマンスを発揮するため、Nemotron-3-Nano-CCおよびNemotron-3-Ultra-CC言語モデル向けのポストトレーニングパイプラインを開発した。大規模な問題キュレーション、合成推論トレース、教師ありファインチューニング、強化学習を組み合わせることで、チームは高度なアルゴリズム的推論能力を持つ専門システムを作成した。
研究者らは、モデルのコンテキストウィンドウを編集可能なファイルとして扱う新しいアーキテクチャであるコンテキスト言語モデル(CLM)を発表した。これにより、モデルは自身のメモリに対して制限のない更新を行うことができる。このアプローチは、コンテキスト管理を外部の制御からモデルの内在的な動作へと移行させ、コンテキスト内の学習とパラメトリックな学習の両方を通じてコンテキスト管理戦略を実現可能にする。
"複数ターンLLC汚染における認識論的ポリシーの分岐:プロトコル勾配調査"と題された研究は、会話履歴に注入された誤った前提を大規模言語モデルがどのように処理するかを評価するものであり、この失敗モードはセッションレベルの汚染と呼ばれています。研究者たちは、温度ゼロで22,500ターンを用いて10の知識領域においてGPT-5.4 Mini、Gemini-3.1 Flash-Lite、GLM-4.5-Airをテストしました。
研究者らは、Retrospection-Only Fine-Tuning (ROFT) を調査している。これはエージェントが自身の経験の回顧的説明を生成し、その説明トークンにおける次のトークン予測損失のみを使用してファインチューニングされる最小限のオンライン手順である。この手法には外部教師や報酬ベースのポリシー更新は必要ない。
研究者らは、推論トレース内のトークンの非一様な価値を活用し、Chain-of-Thought推論の高いトークン消費に対処するフレームワークであるTokenProbeを発表しました。この手法は、正規化された対数確率信号を使用して、決定的な内容を含むコアトークンと冗長なフィラーを区別します。
研究者たちは、Vision Answerability Diagnosis with Rationales (VAD-R) を導入した。これは、ショートカットの手がかりなしに答えられない質問に対して回答を控えるビジョン言語モデルの能力を評価するために設計された新しいベンチマークである。本研究は、隠れ状態が回答可能性を区別できる一方で、現在のモデルはこの情報を明示的な意思決定に変換できないことを明らかにした。
研究者らは、Highlight-Then-Summarize (H2S) を提案した。これは、質問に関連する証拠を特定し、回答を生成する前にそれをコンパクトな要約に統合する「圧縮後に推論する」パラダイムである。このアプローチをサポートするために、チームは11のベンチマークファミリーから6,647例を含むH2S-Datasetを構築し、プロセスレベルの報酬のためのH2S-RLを導入した。
研究者らは、「古い文書の汚染」という時間的整合性の失敗を特定した。これは、Retrieval-Augmented Generation (RAG) において、古びた外部証拠が、検索なしでは正しい応答を知っているにもかかわらず、モデルが誤った回答を提供する原因となる現象である。
Tencentは、生のユーザー履歴を会話エージェントやレコメンダーのためのコンパクトな表現に凝縮する統一された行動圧縮レイヤーであるKuaFuを導入しました。このシステムは2軸プロジェクターを使用して、各行動アイテムを幅128-256の2〜4トークンに圧縮し、十億人のユーザーに対する長いシーケンスの処理におけるボトルネックに対処します。
ツール利用エージェント向けの新しいコルーチンブリッジハーネスが、CAR-bench評価のトラック2で優勝し、公式の非公開テストセットにおいて60.0%のPass@3スコアを達成した。このシステムは、モデルが評価者とのやり取り間でブロックおよび再開するPythonプログラムを出力することで、モデル呼び出しとツールの往復を分離している。
研究者らは、非常に大きなコンテキストの有効な表現を構築するために認知理論の原則を運用化するハーネスであるR3Conを提案する。このシステムは、標準的なモデルのコンテキスト制限を超えて広大なソースに散らばった相互依存情報を組み立てる課題に対処する。
VHD-Playは、数学的モデルのサンプリングと求解を経て、その意思決定プロセスを状態保持ツールとしてレンダリングすることで、多様な自律型強化学習環境を生成するパイプラインである。このアプローチにより、実行可能なダイナミクスや軌道スコアリングの参照が解決済みモデルから直接継承され、既存のパイプラインで一般的にみられる不整合の問題に対処する。
著者らは、WebMREを紹介する。これは541のタスクと5,293のステップからなるオフラインベンチマークで、成功したWebArenaの軌道から派生しており、環境ドリフトなしでウェブエージェントのチェックポイントをスコアリングするための決定論的なプロトコルを提供することを目的としている。このフレームワークは、人間向けのガイド文と接地された行動をペアにして、それらの間の相互強化効果を研究する。
研究者らは、人間が記述したエージェントのスキルを実行可能で検証可能なトレーニング環境に変換するフレームワーク「SkillGym」を発表した。このシステムは、スキルからタスクへのパイプラインを活用して具体的なタスクをインスタンス化し、コードベースのチェッカーによって結果を検証する。
研究者らは、集中オーケストレーターのボトルネックを解消し、並行ワーカーがサブタスクを非同期で引き受けて進捗をマージできるようにする、スケーラブルな自己組織化マルチエージェントハーネスである Agensh を紹介しました。
研究者らは、TelecomGPT-R1を発表した。これは、規格、構成、ログに対する推論を通じてエンジニアリングタスクを自動化するために設計された、オープンソースの統一型テレコム推論モデルファミリーである。このモデルは、プロトコル、知識、モデリング、障害の各軸をカバーする構造化アプローチを通じて、既存の汎用および専門的なLLMの制限に対処する。
Alibaba Cloudは、実世界の生産性タスク向けに設計されたネイティブな多モーダルエージェントモデルであるQwen3.8-Omni-Flashを発表しました。このモデルは、以前のオムニモデルと比較して、多モーダルな理解と推論を大幅に改善します。
著者らは、合成データとルーブリックベースの強化学習を用いて、診断および臨床医療の推論の両方を強化する 30B パラメータのモデル Fathom-Vaidya を紹介しています。
研究者らは、単一の最先端モデルをすべてのタスクに使用するのではなく、個々の軌跡のステップを適切なモデル階層にルーティングすることで、マルチステップのエージェントワークフローを最適化する軽量な分類器であるAgentRouterを提案している。このシステムは、より小さなモデルでも同等に処理できるサブタスクに対して推論予算の60〜80%を浪費するエンタープライズシステムの非効率性に対処する。
NemotronLabsは、聴取、文字起こし、推論、発話を統一されたストリーミングアーキテクチャ内で統合するために設計されたオープンウェイトのフルデュープレックス音声対話モデルであるVoiceChatを発表した。本システムは、ストリーミング音声エンコーダとデコーダのみからなる言語モデルを組み合わせ、エージェントテキストおよび構造化関数呼び出し用の並列専用出力ストリームに加え、逐次ユーザー文字起こし用の補助的なRNN-Tブランチを搭載している。