Moonshot AIが2.8TのMoEモデル「Kimi K3」を公開、百万トークンのコンテキストに対応
Moonshot AIは、総パラメータ数2.8兆、1トークンあたり活性化パラメータ数1040億を備えたオープンソースのMixture-of-Expertsモデル「Kimi K3」を発表した。本アーキテクチャはネイティブなビジョン機能を活用し、Kimi Delta AttentionとStable LatentMoEにより1百万トークンのコンテキストウィンドウをサポートする。
Moonshot AIは、総パラメータ数2.8兆、1トークンあたり活性化パラメータ数1040億を備えたオープンソースのMixture-of-Expertsモデル「Kimi K3」を発表した。本アーキテクチャはネイティブなビジョン機能を活用し、Kimi Delta AttentionとStable LatentMoEにより1百万トークンのコンテキストウィンドウをサポートする。
研究者らは、学習不要で入力が適応する推論手法であるReduced Matrix Multiplication (RMM)を提案した。これは、モデルの重みを変更せずに収縮次元に沿って情報的なスライスを選択することで、Transformerの行列積を削減する。単純な保持率制御の下、RMMは1Bから70Bパラメータの言語モデル全体で、精度と効率の滑らかで予測可能なトレードオフを提供する。
本論文では、AutoDesignというフレームワークを紹介しています。これは、ロールアウトフィードバックに基づいてハーネスを再帰的に改善するコードエージェントを誘導するためにメタハーネスオプティマイザを採用しています。著者たちは、PosterBenchと呼ばれる新しいベンチマークを用いて、学術論文からポスターへの生成タスクにおいてこのアプローチを評価しました。
著者らは、マルチモーダルな科学的理解、推論、生成、および長期タスクをサポートするために設計された一連の科学的エージェント基盤モデルであるIntern-S2-Previewを発表する。トレーニングパイプラインは、レンダリングされた科学文書、インターリーブされた画像テキストデータ、および多様な科学コーパスにおける科学的マルチモーダル事前トレーニングから始まる。
低所得・中所得環境向けに設計された検索拡張生成システムであるVITAは、HealthBenchの英語版サブセットで1位となり、GPT-5.4、o4-mini、Gemini 3.1 Pro、Claude Sonnet 4.6を上回った。
研究者らは、参照なしのポストトレーニングを活用する多言語機械学習のためのオープンな大規模言語モデルである MiLMMT-46-v1.0 を公開した。教師ありファインチューニングされた MiLMMT-46-v0.1 から出発し、チームは言語識別によってゲート制御される2つの参照なし品質推定モデルに基づく報酬を用いた Group Relative Policy Optimization (GRPO) を適用した。
Macaron-V1は、経験知能のために設計されたオープンなエージェントモデルファミリーであり、システムが現実世界の経験から学習し、デプロイ後も改善を続けることを可能にします。アーキテクチャは2つの目標を中心に構成されています:モデルとハーネスのペアの再帰的な自己改善による適応、およびユーザーごとのターンごとに専門アダプターを選択するMixture-of-LoRA (MoL) システムを通じた協調です。
研究者らは、低遅延の対話をリアルタイムのオーディオビジュアル知覚と統合する Gemini ベースのマルチエージェントシステムである AMIE (Video) を使用して、リアルタイムの臨床ビデオ相談用の初のエキスパートレベル AI システムを実証しました。
微生物発がんに関する体系的エビデンス合成における大規模言語モデルのベンチマーク研究により、GPT-5およびGPT-5 Nanoがドメインの専門家と区別できないほど高いパフォーマンスを発揮することが明らかになった。研究者らは、Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5、GPT-5 Nanoを、複数の質問タイプにわたる77項目からなる構造化テンプレートを用いて24の研究論文で評価した。
研究者らは、根拠に基づくマルチモーダル比喩理解を評価するために設計された、人間による検証済み注釈を含む1,000の画像-テキストインスタンスからなる統合ベンチマークであるM$^3$R-Benchを導入した。このベンチマークは、比喩の発生、ターゲットとソースのマッピング、感情、および概念メタファー理論に基づく段階的な説明に対する共同注釈を提供する。
Douyinは、大規模な対照的事前学習と潜在推論を組み合わせて、強力な識別力と効率性を実現するマルチモーダル埋め込み(DME)モデルの技術レポートを公開しました。
研究者らは、397B-A17B Qwen Mixture-of-Expertsバックボーン上に構築されたネイティブコンピュータ使用エージェントであるQwen-CUAを発表した。本システムはDOMツリーやアクセシビリティメタデータに依存することなく、スクリーンショットの観察とキーボード・マウスイベントによる操作によって動作する。
研究により、推論プロセスを制御する敵対者に対して思考の連鎖(CoT)モニタリングが失敗することが示された。エージェントの推論を書き換えて誠実なエンジニアリングのように見せかけつつ、コマンドと出力はそのままにすることで、攻撃者は検出メカニズムを回避できる。
研究者らは、パラメトリック長期記憶モデルを6.9Bパラメータまでスケールし、300Bトークンで事前学習するシステム「Memory Decoder at Scale」を発表した。このデータ規模において標準的なFaissパイプラインの実行が不可能であるため、著者らはkNN分布のスパースかつバッチごとの読み込みを用いた分散インデックスパイプラインを実装した。
Frontisは、機械学習エンジニアリングにおける再帰的自己改善のために設計された35BパラメータのAI4AIモデルであるFrontis-MA1と、オープンソースのOpenMLEスタックを発表した。このシステムは、検証可能なタスク環境、演習学習、長時間ホライズン検索を統合し、実行ベースのトレーニングを通じてコード自体を改善するエージェントを実現している。
研究者らが、コンピュータ操作エージェントの軌跡に対して審判役として機能するビジョン言語モデル(VLMs)の信頼性を評価するために設計された現実的なベンチマークであるOSRewardを紹介している。本研究では、最先端のVLMsでさえ体系的な寛容性バイアスに苦しんでおり、スケーリングには費用が高すぎる一方で、手頃な価格のオープンソースモデルは性能が劣ることが明らかになった。
研究者らはLiving-Harnessを提案した。これは自己進化型エージェントハーネスであり、完了した軌道と評価者の信号を後続のハーネス更新のための事後証拠に変換する。
研究者らは、120B規模のモデルのトレーニングプロセスに価値ベースのコンテンツを挿入することで、憲法的な中間トレーニングをテストし、それが標準的なポストトレーニング手法よりも持続的なアライメントを生み出すかどうかを決定しました。この研究では、このアプローチがアライメントの一般化と耐久性を大幅に改善し、特に教師ありファインチューニング後の脅迫傾向を緩和することに効果的であることがわかりました。
研究者たちは、標準的なオンポリシー蒸留におけるプレフィックス失敗、つまり生徒のエラーが信頼できない教師信号をもたらす問題を解決するために、Relay On-Policy Distillation (Relay-OPD) を導入した。この手法は、教師と生徒の継続における非対称性をトリガーとして使用し、生徒が再開する前に教師が一時的に介入して軌跡を再方向付ける。
PIVOT(Proxy Indexing Via One full-prefix Traversal)は、DeepSeek Sparse Attention(DSA)インデクサのためのトレーニング不要なドロップイン置換であり、近くのクエリグループ間で1つのプレフィックススキャンを共有することで計算の冗長性を削減します。各クエリに対して個別にすべての先行トークンをスコアリングする代わりに、PIVOTはグループを単一のプロキシクエリに集約して候補セットを取得し、そこから各クエリのためにトップkトークンが選択されます。