Research paper
arxiv arXiv cs.LG · 2日前

U-OPSDはLLMのための教師なしオンポリシー自己蒸留を可能にする

研究者らは、外部の監督なしでモデル自身の生成のみを使用して大規模言語モデルのトレーニング後の改善を実現する手法である教師なしオンポリシー自己蒸留(U-OPSD)を提案した。このアプローチは複数のロールアウトをサンプリングして多数決により疑似解を構築し、教師分布をモデルの最長の不正解完了のプレフィックスに蒸留する。

arxiv arXiv cs.CL · 2日前

M$^3$R-Benchがマルチモーダル比喩理解のための根拠付きベンチマークを導入

研究者らは、根拠に基づくマルチモーダル比喩理解を評価するために設計された、人間による検証済み注釈を含む1,000の画像-テキストインスタンスからなる統合ベンチマークであるM$^3$R-Benchを導入した。このベンチマークは、比喩の発生、ターゲットとソースのマッピング、感情、および概念メタファー理論に基づく段階的な説明に対する共同注釈を提供する。

arxiv arXiv cs.AI · 3日前 SWE-bench Pro · 78.0%

Argus: 長期推論のための汎用エージェントランタイム

研究者らは、安定したユーザー意図と運用目標を分離し、長期推論のために設計された永続的で自己進化型のエージェントランタイムであるArgusを発表した。このシステムは、Manager、Planner、Engineer、Reviewerの役割を活用して、耐久性のあるプロジェクト状態上で制約付きミッションを実行し、オペレーターによるエスカレーションポイント間で自律的な実行を可能にする。

media MarkTechPost · 3日前

MicrosoftのSkillOptにより、CodexとClaude Code間でエージェントのスキル転送が可能に

Microsoft、上海交通大学、同済大学、復旦大学の研究者らは、ターゲットモデルを凍結したまま自然言語によるスキル文書を訓練するテキスト空間最適化器であるSkillOptを開発した。本システムはオプティマイザモデルを用いてスコア付きロールアウトに基づく制約付き編集を提案し、その結果を単一の`best_skill.md`ファイルとしてエクスポートする。

lab NVIDIA Research · 3日前 · 5 回表示

ROSAが共有GPUプールサービングにより工場生産性を最大12.06倍向上

研究者らは、ロボット工場で使用されることを目的としたロボティクス基盤モデルのサービングシステム「ROSA」を提案した。これは単一ロボットやエッジコンピューティングの前提を超えたものである。本システムは共有GPUプールサービングを活用し、ロボット群がネットワーク経由でサーバークラスのGPUにアクセスできるようにする。

arxiv arXiv cs.LG · 5日前 OSWorld 2.0 · 21.2% · 6 回表示

Qwenが397B-A17Bのネイティブコンピュータ使用エージェント「Qwen-CUA」をリリース

Qwenは、DOMツリーやアクセシビリティメタデータに依存せず、スクリーンショットと入力イベントを通じて動作する397B-A17BのMixture-of-Expertsバックボーン上に構築されたネイティブコンピュータ使用エージェント「Qwen-CUA」を発表した。本システムは最大20枚のアクティブなスクリーンショットを維持するためのスケフォールドを利用し、約40,000件の検証可能なタスクにわたるほぼ100,000 vCPUのクラウドロールアウトフリートを用いてトレーニングされた。

arxiv arXiv cs.CL · 5日前 OSWorld 2.0 · 21.2% · 4 回表示

Qwenが397B-A17Bのネイティブコンピュータ使用エージェント「Qwen-CUA」をリリース

研究者らは、397B-A17B Qwen Mixture-of-Expertsバックボーン上に構築されたネイティブコンピュータ使用エージェントであるQwen-CUAを発表した。本システムはDOMツリーやアクセシビリティメタデータに依存することなく、スクリーンショットの観察とキーボード・マウスイベントによる操作によって動作する。

lab OpenAI News · 8日前 · 16 回表示

Astraモデルが数学および理論計算機科学の10の未解決問題を解決

OpenAIの内部モデルAstraは、数学および理論計算機科学にわたる10の長年の未解決問題に対する解答を生成し、その論証はLeanで形式化された。これらの結果は高次元幾何学、符号理論、群論、量子複雑性にまたがり、少なくとも10年間進展が見られなかった問いに対処している。

arxiv arXiv cs.CL · 9日前 · 2 回表示

大規模なメモリデコーダ: パラメトリック長期記憶を6.9Bパラメータにスケール

研究者らは、パラメトリック長期記憶モデルを6.9Bパラメータまでスケールし、300Bトークンで事前学習するシステム「Memory Decoder at Scale」を発表した。このデータ規模において標準的なFaissパイプラインの実行が不可能であるため、著者らはkNN分布のスパースかつバッチごとの読み込みを用いた分散インデックスパイプラインを実装した。

arxiv arXiv cs.AI · 9日前 WebArena · 73.6% · 2 回表示

Qwen-UI-Agentがモバイルユースベンチマークで最良の成果を達成

Qwenチームは、モバイル、コンピュータ使用、Web、DeepSearch環境で信頼性の高い操作を実現するために設計された、現実世界中心の基盤GUIエージェントであるQwen-UI-Agentの技術レポートを発表しました。本システムは、多様なサンドボックス環境と大規模な実機モバイルランタイムを組み合わせ、GUI操作とCLI実行を交互に行い、長期のタスクをサポートします。

arxiv arXiv cs.CL · 10日前 · 3 回表示

憲法的な中間トレーニングは、能力の低下なしに持続的なアライメントの向上をもたらす

研究者らは、120B規模のモデルのトレーニングプロセスに価値ベースのコンテンツを挿入することで、憲法的な中間トレーニングをテストし、それが標準的なポストトレーニング手法よりも持続的なアライメントを生み出すかどうかを決定しました。この研究では、このアプローチがアライメントの一般化と耐久性を大幅に改善し、特に教師ありファインチューニング後の脅迫傾向を緩和することに効果的であることがわかりました。