ソース · arXiv cs.LG
arxiv arXiv cs.LG · 18日前 · 3 回表示

Moonshot AIが2.8TパラメータのMoEモデル「Kimi K3」を公開、百万トークンのコンテキストに対応

Moonshot AIは、総パラメータ数2.8兆、1トークンあたり1040億のパラメータが活性化されるオープンソースのMixture-of-Expertsモデル「Kimi K3」を発表した。同モデルはネイティブなビジョン機能と100万トークンのコンテキストウィンドウをサポートし、Kimi Delta AttentionおよびStable LatentMoEを活用することで、前世代のKimi K2と比較して約2.5倍のスケーリング効率を実現している。

arxiv arXiv cs.LG · 16時間前 · 1 回表示

Faraday 27B が論文再現タスクにおいて Claude Opus 4.8 および GPT-5.5 を上回る

研究者らは、信頼性の高い科学知識の必要性に対応するため、論文再現のためのスケーラブルなタスク空間である Replica を開発しました。彼らは、この環境を活用するために、コーディングエージェントをツールとして使用する 27B パラメータの「AI Scientist」エージェントである Faraday のファインチューニングを行いました。

arxiv arXiv cs.LG · 16時間前

Intern-S2-Preview: 科学用アジェンティック基盤モデル

著者らは、マルチモーダルな科学的理解、推論、生成、および長期タスクをサポートするために設計された一連の科学用アジェンティック基盤モデルであるIntern-S2-Previewを発表する。トレーニングパイプラインは、レンダリングされた科学文書、インターリーブされた画像テキストデータ、および多様な科学コーパスにおける科学マルチモーダル事前学習から始まる。

arxiv arXiv cs.LG · 2日前 HealthBench · 51.9% · 5 回表示

VITA臨床RAGシステムはHealthBenchで最先端LLMと同等またはそれ以上の性能

低所得および中所得環境向けに設計された専用検索拡張生成(RAG)システムであるVITAが、HealthBenchベンチマークにおいて汎用大規模言語モデルと比較評価されました。GPT-4.1ジャッジによって採点された4,023問の質問において、VITAはルーブリックのポイントの51.9%を獲得し1位となり、GPT-5.4、o4-mini、Gemini 3.1 Pro、Claude Sonnet 4.6を上回りました。

arxiv arXiv cs.LG · 4日前 · 2 回表示

Macaron-V1が継続学習のためのMixture-of-LoRAを用いたオープンなエージェントモデルファミリーを導入

Macaron-V1は、経験知能のために設計されたオープンなエージェントモデルファミリーであり、実際の環境からの学習と展開後の継続的な学習を可能にします。このシステムは2つの目標に焦点を当てています:モデルとハーネスのペアの再帰的改善による適応、およびユーザーごとのターンごとに専門家のLoRAアダプターを選択するMixture-of-LoRA (MoL) アーキテクチャを通じた協調です。

arxiv arXiv cs.LG · 4日前 · 11 回表示

研究者がクロスセッション暗号化の再利用を悪用し、LLM API から推論トレースを窃取

研究者らは、主要な大規模言語モデルプロバイダーがクライアント側で使用するために暗号化ブロックとして返すステップバイステップの推論トレースの処理方法に脆弱性を見つけた。彼らは、これらの暗号化ブロックが同じプロバイダーのエコシステム内において、異なるセッション、ユーザー、およびモデル間で完全に互換性があり交換可能であることを発見した。

arxiv arXiv cs.LG · 8日前

U-OPSDはLLMのための教師なしオンポリシー自己蒸留を可能にする

研究者らは、外部の監督なしでモデル自身の生成のみを使用して大規模言語モデルのトレーニング後の改善を実現する手法である教師なしオンポリシー自己蒸留(U-OPSD)を提案した。このアプローチは複数のロールアウトをサンプリングして多数決により疑似解を構築し、教師分布をモデルの最長の不正解完了のプレフィックスに蒸留する。

arxiv arXiv cs.LG · 11日前 OSWorld 2.0 · 21.2% · 20 回表示

Qwenが397B-A17Bのネイティブコンピュータ使用エージェント「Qwen-CUA」をリリース

Qwenは、DOMツリーやアクセシビリティメタデータに依存せず、スクリーンショットと入力イベントを通じて動作する397B-A17BのMixture-of-Expertsバックボーン上に構築されたネイティブコンピュータ使用エージェント「Qwen-CUA」を発表した。本システムは最大20枚のアクティブなスクリーンショットを維持するためのスケフォールドを利用し、約40,000件の検証可能なタスクにわたるほぼ100,000 vCPUのクラウドロールアウトフリートを用いてトレーニングされた。

arxiv arXiv cs.LG · 28日前 · 2 回表示

RoboTTTは8Kタイムステップのコンテキストにロボットポリシーをスケールさせる

研究者らは、視覚運動コンテキストをロボット基盤モデル向けに8,000タイムステップまで拡張しつつ推論レイテンシを増加させないトレーニングレシピであるRoboTTTを発表した。この手法は、トレーニングと推論の両方で勾配降下によって更新される高速重みを用いることで、テストタイムトレーニングをビジョン・ランゲージ・アクションポリシーに統合する。