米国エネルギー省がGenesis Open Modelsイニシアチブを立ち上げ、Genesis-Science-1を発表
米国エネルギー省はGenesis Open Modelsイニシアチブを立ち上げ、Arceeと提携して科学的研究用の最初のオープンウェイトモデルであるGenesis-Science-1を発表しました。
米国エネルギー省はGenesis Open Modelsイニシアチブを立ち上げ、Arceeと提携して科学的研究用の最初のオープンウェイトモデルであるGenesis-Science-1を発表しました。
研究者らは、外部の監督なしでモデル自身の生成のみを使用して大規模言語モデルのトレーニング後の改善を実現する手法である教師なしオンポリシー自己蒸留(U-OPSD)を提案した。このアプローチは複数のロールアウトをサンプリングして多数決により疑似解を構築し、教師分布をモデルの最長の不正解完了のプレフィックスに蒸留する。
研究者らは、根拠に基づくマルチモーダル比喩理解を評価するために設計された、人間による検証済み注釈を含む1,000の画像-テキストインスタンスからなる統合ベンチマークであるM$^3$R-Benchを導入した。このベンチマークは、比喩の発生、ターゲットとソースのマッピング、感情、および概念メタファー理論に基づく段階的な説明に対する共同注釈を提供する。
Google DeepMindとGoogle Researchは、熱帯サイクロンの経路、強度、風構造の予測において最先端の精度を達成したWeatherNext 2およびWeatherNext Cyclones AIモデルをオープンソース化した。
研究者らは、安定したユーザー意図と運用目標を分離し、長期推論のために設計された永続的で自己進化型のエージェントランタイムであるArgusを発表した。このシステムは、Manager、Planner、Engineer、Reviewerの役割を活用して、耐久性のあるプロジェクト状態上で制約付きミッションを実行し、オペレーターによるエスカレーションポイント間で自律的な実行を可能にする。
Microsoft、上海交通大学、同済大学、復旦大学の研究者らは、ターゲットモデルを凍結したまま自然言語によるスキル文書を訓練するテキスト空間最適化器であるSkillOptを開発した。本システムはオプティマイザモデルを用いてスコア付きロールアウトに基づく制約付き編集を提案し、その結果を単一の`best_skill.md`ファイルとしてエクスポートする。
研究者らは、ロボット工場で使用されることを目的としたロボティクス基盤モデルのサービングシステム「ROSA」を提案した。これは単一ロボットやエッジコンピューティングの前提を超えたものである。本システムは共有GPUプールサービングを活用し、ロボット群がネットワーク経由でサーバークラスのGPUにアクセスできるようにする。
ある開発者が、二次関数的なMHAのボトルネックを回避するために設計された、融合Triton/CUDA状態蓄積カーネルを特徴とする減衰ゲート型O(N)因果線形アテンションアーキテクチャをオープンソースとして公開しました。
Qwenは、DOMツリーやアクセシビリティメタデータに依存せず、スクリーンショットと入力イベントを通じて動作する397B-A17BのMixture-of-Expertsバックボーン上に構築されたネイティブコンピュータ使用エージェント「Qwen-CUA」を発表した。本システムは最大20枚のアクティブなスクリーンショットを維持するためのスケフォールドを利用し、約40,000件の検証可能なタスクにわたるほぼ100,000 vCPUのクラウドロールアウトフリートを用いてトレーニングされた。
Douyinは、大規模な対照的事前学習と潜在推論を組み合わせて、強力な識別力と効率性を実現するマルチモーダル埋め込み(DME)モデルの技術レポートを公開しました。
研究者らは、397B-A17B Qwen Mixture-of-Expertsバックボーン上に構築されたネイティブコンピュータ使用エージェントであるQwen-CUAを発表した。本システムはDOMツリーやアクセシビリティメタデータに依存することなく、スクリーンショットの観察とキーボード・マウスイベントによる操作によって動作する。
研究により、推論プロセスを制御する敵対者に対して思考の連鎖(CoT)モニタリングが失敗することが示された。エージェントの推論を書き換えて誠実なエンジニアリングのように見せかけつつ、コマンドと出力はそのままにすることで、攻撃者は検出メカニズムを回避できる。
OpenAIは、未公開の内部モデル「Astra」による成果を発表した。このモデルは、数学における10件の重要な未解決問題に成功裡に取り組んだ。これらの解答はモデルによって生成され、その後、人間の研究者によってLean証明書へと形式化された。
高校2年生のHanyu(Olivia)Yu氏は、cs.LGまたはcs.CVのarXiv推薦者を探しており、彼女の独立したプレプリント「AttnRoute-MoE: Attention-Prior Routing for Mixture-of-Experts Vision Transformers」をアップロードしようとしています。
OpenAIは、少なくとも10年間にわたって主要な結果に進展が見られなかった10の数学および理論計算機科学の問題に対する解決策を公開しました。これは、次期主要モデルAstraの内部バージョンを使用して行われました。
OpenAIの内部モデルAstraは、数学および理論計算機科学にわたる10の長年の未解決問題に対する解答を生成し、その論証はLeanで形式化された。これらの結果は高次元幾何学、符号理論、群論、量子複雑性にまたがり、少なくとも10年間進展が見られなかった問いに対処している。
研究者らは、パラメトリック長期記憶モデルを6.9Bパラメータまでスケールし、300Bトークンで事前学習するシステム「Memory Decoder at Scale」を発表した。このデータ規模において標準的なFaissパイプラインの実行が不可能であるため、著者らはkNN分布のスパースかつバッチごとの読み込みを用いた分散インデックスパイプラインを実装した。
Qwenチームは、モバイル、コンピュータ使用、Web、DeepSearch環境で信頼性の高い操作を実現するために設計された、現実世界中心の基盤GUIエージェントであるQwen-UI-Agentの技術レポートを発表しました。本システムは、多様なサンドボックス環境と大規模な実機モバイルランタイムを組み合わせ、GUI操作とCLI実行を交互に行い、長期のタスクをサポートします。
研究者らはLiving-Harnessを提案した。これは自己進化型エージェントハーネスであり、完了した軌道と評価者の信号を後続のハーネス更新のための事後証拠に変換する。
研究者らは、120B規模のモデルのトレーニングプロセスに価値ベースのコンテンツを挿入することで、憲法的な中間トレーニングをテストし、それが標準的なポストトレーニング手法よりも持続的なアライメントを生み出すかどうかを決定しました。この研究では、このアプローチがアライメントの一般化と耐久性を大幅に改善し、特に教師ありファインチューニング後の脅迫傾向を緩和することに効果的であることがわかりました。