ソース · arXiv cs.CL
arxiv arXiv cs.CL · 28日前 · 35 回表示

NVIDIA Nemotron-3モデルがIOIプログラミング競技で金メダル級の性能を達成

NVIDIAは、競合プログラミングにおいて卓越したパフォーマンスを発揮するため、Nemotron-3-Nano-CCおよびNemotron-3-Ultra-CC言語モデル向けのポストトレーニングパイプラインを開発した。大規模な問題キュレーション、合成推論トレース、教師ありファインチューニング、強化学習を組み合わせることで、チームは高度なアルゴリズム的推論能力を持つ専門システムを作成した。

arxiv arXiv cs.CL · 17時間前 · 1 回表示

コンテキスト言語モデルはコンテキストをネイティブに編集可能なファイルとして管理する

研究者らは、モデルのコンテキストウィンドウを編集可能なファイルとして扱う新しいアーキテクチャであるコンテキスト言語モデル(CLM)を発表した。これにより、モデルは自身のメモリに対して制限のない更新を行うことができる。このアプローチは、コンテキスト管理を外部の制御からモデルの内在的な動作へと移行させ、コンテキスト内の学習とパラメトリックな学習の両方を通じてコンテキスト管理戦略を実現可能にする。

arxiv arXiv cs.CL · 2日前 · 1 回表示

複数ターンLLMの汚染における認識論的ポリシーの分岐に関する研究

"複数ターンLLC汚染における認識論的ポリシーの分岐:プロトコル勾配調査"と題された研究は、会話履歴に注入された誤った前提を大規模言語モデルがどのように処理するかを評価するものであり、この失敗モードはセッションレベルの汚染と呼ばれています。研究者たちは、温度ゼロで22,500ターンを用いて10の知識領域においてGPT-5.4 Mini、Gemini-3.1 Flash-Lite、GLM-4.5-Airをテストしました。

arxiv arXiv cs.CL · 2日前 SWE-bench Verified · 49.2% · 1 回表示

ROFTは自己生成された説明でのファインチューニングによりエージェントモデルを改善する

研究者らは、Retrospection-Only Fine-Tuning (ROFT) を調査している。これはエージェントが自身の経験の回顧的説明を生成し、その説明トークンにおける次のトークン予測損失のみを使用してファインチューニングされる最小限のオンライン手順である。この手法には外部教師や報酬ベースのポリシー更新は必要ない。

arxiv arXiv cs.CL · 2日前 · 1 回表示

TokenProbeは精度を維持しながらCoTトークン使用量を76%削減

研究者らは、推論トレース内のトークンの非一様な価値を活用し、Chain-of-Thought推論の高いトークン消費に対処するフレームワークであるTokenProbeを発表しました。この手法は、正規化された対数確率信号を使用して、決定的な内容を含むコアトークンと冗長なフィラーを区別します。

arxiv arXiv cs.CL · 2日前 · 1 回表示

Rep2ActはVAD-Rベンチマークにおける新規 abstention を改善するためにVLM表現を整合させる

研究者たちは、Vision Answerability Diagnosis with Rationales (VAD-R) を導入した。これは、ショートカットの手がかりなしに答えられない質問に対して回答を控えるビジョン言語モデルの能力を評価するために設計された新しいベンチマークである。本研究は、隠れ状態が回答可能性を区別できる一方で、現在のモデルはこの情報を明示的な意思決定に変換できないことを明らかにした。

arxiv arXiv cs.CL · 3日前 · 6 回表示

Highlight-Then-Summarizeは、より良い長期コンテキスト理解のために証拠を圧縮する

研究者らは、Highlight-Then-Summarize (H2S) を提案した。これは、質問に関連する証拠を特定し、回答を生成する前にそれをコンパクトな要約に統合する「圧縮後に推論する」パラダイムである。このアプローチをサポートするために、チームは11のベンチマークファミリーから6,647例を含むH2S-Datasetを構築し、プロセスレベルの報酬のためのH2S-RLを導入した。

arxiv arXiv cs.CL · 3日前 · 7 回表示

KuaFuは十億規模でユーザー行動を理解に圧縮する

Tencentは、生のユーザー履歴を会話エージェントやレコメンダーのためのコンパクトな表現に凝縮する統一された行動圧縮レイヤーであるKuaFuを導入しました。このシステムは2軸プロジェクターを使用して、各行動アイテムを幅128-256の2〜4トークンに圧縮し、十億人のユーザーに対する長いシーケンスの処理におけるボトルネックに対処します。

arxiv arXiv cs.CL · 6日前 · 9 回表示

コルーチンブリッジハーネスがCAR-benchトラック2で60.0% Pass^3を獲得

ツール利用エージェント向けの新しいコルーチンブリッジハーネスが、CAR-bench評価のトラック2で優勝し、公式の非公開テストセットにおいて60.0%のPass@3スコアを達成した。このシステムは、モデルが評価者とのやり取り間でブロックおよび再開するPythonプログラムを出力することで、モデル呼び出しとツールの往復を分離している。

arxiv arXiv cs.CL · 7日前 · 8 回表示

VHD-Playは解決されたメカニズムから自律型RL環境を生成する

VHD-Playは、数学的モデルのサンプリングと求解を経て、その意思決定プロセスを状態保持ツールとしてレンダリングすることで、多様な自律型強化学習環境を生成するパイプラインである。このアプローチにより、実行可能なダイナミクスや軌道スコアリングの参照が解決済みモデルから直接継承され、既存のパイプラインで一般的にみられる不整合の問題に対処する。

arxiv arXiv cs.CL · 7日前 · 2 回表示

WebMREベンチマークがウェブエージェントにおけるガイドと行動の相互強化を明らかにする

著者らは、WebMREを紹介する。これは541のタスクと5,293のステップからなるオフラインベンチマークで、成功したWebArenaの軌道から派生しており、環境ドリフトなしでウェブエージェントのチェックポイントをスコアリングするための決定論的なプロトコルを提供することを目的としている。このフレームワークは、人間向けのガイド文と接地された行動をペアにして、それらの間の相互強化効果を研究する。

arxiv arXiv cs.CL · 7日前 SWE-Lancer · 51.47% · 10 回表示

SkillGymが人間のスキルをLLMに内部化し、現実世界の問題解決を実現

研究者らは、人間が記述したエージェントのスキルを実行可能で検証可能なトレーニング環境に変換するフレームワーク「SkillGym」を発表した。このシステムは、スキルからタスクへのパイプラインを活用して具体的なタスクをインスタンス化し、コードベースのチェッカーによって結果を検証する。

arxiv arXiv cs.CL · 8日前 · 19 回表示

TelecomGPT-R1: 異種テレコムタスクにわたる推論のための統一後学習

研究者らは、TelecomGPT-R1を発表した。これは、規格、構成、ログに対する推論を通じてエンジニアリングタスクを自動化するために設計された、オープンソースの統一型テレコム推論モデルファミリーである。このモデルは、プロトコル、知識、モデリング、障害の各軸をカバーする構造化アプローチを通じて、既存の汎用および専門的なLLMの制限に対処する。

arxiv arXiv cs.CL · 8日前 · 19 回表示

Qwenが100万トークンコンテキストを備えたネイティブ多モーダルエージェントモデル「Qwen3.8-Omni-Flash」をリリース

Alibaba Cloudは、実世界の生産性タスク向けに設計されたネイティブな多モーダルエージェントモデルであるQwen3.8-Omni-Flashを発表しました。このモデルは、以前のオムニモデルと比較して、多モーダルな理解と推論を大幅に改善します。

arxiv arXiv cs.CL · 9日前 · 15 回表示

AgentRouterがステップレベルのモデルルーティングによりエージェントワークフローのコストを72%削減

研究者らは、単一の最先端モデルをすべてのタスクに使用するのではなく、個々の軌跡のステップを適切なモデル階層にルーティングすることで、マルチステップのエージェントワークフローを最適化する軽量な分類器であるAgentRouterを提案している。このシステムは、より小さなモデルでも同等に処理できるサブタスクに対して推論予算の60〜80%を浪費するエンタープライズシステムの非効率性に対処する。

arxiv arXiv cs.CL · 10日前 · 17 回表示

NemotronLabsがツール呼び出し機能を備えたオープンなフルデュープレックス音声対話モデル「VoiceChat」をリリース

NemotronLabsは、聴取、文字起こし、推論、発話を統一されたストリーミングアーキテクチャ内で統合するために設計されたオープンウェイトのフルデュープレックス音声対話モデルであるVoiceChatを発表した。本システムは、ストリーミング音声エンコーダとデコーダのみからなる言語モデルを組み合わせ、エージェントテキストおよび構造化関数呼び出し用の並列専用出力ストリームに加え、逐次ユーザー文字起こし用の補助的なRNN-Tブランチを搭載している。