ソース · arXiv cs.CL
arxiv arXiv cs.CL · 18日前 · 6 回表示

Moonshot AIが2.8TのMoEモデル「Kimi K3」を公開、百万トークンのコンテキストに対応

Moonshot AIは、総パラメータ数2.8兆、1トークンあたり活性化パラメータ数1040億を備えたオープンソースのMixture-of-Expertsモデル「Kimi K3」を発表した。本アーキテクチャはネイティブなビジョン機能を活用し、Kimi Delta AttentionとStable LatentMoEにより1百万トークンのコンテキストウィンドウをサポートする。

arxiv arXiv cs.CL · 22時間前

行列積の削減: LLM推論のための入力適応型行列積削減手法

研究者らは、学習不要で入力が適応する推論手法であるReduced Matrix Multiplication (RMM)を提案した。これは、モデルの重みを変更せずに収縮次元に沿って情報的なスライスを選択することで、Transformerの行列積を削減する。単純な保持率制御の下、RMMは1Bから70Bパラメータの言語モデル全体で、精度と効率の滑らかで予測可能なトレードオフを提供する。

arxiv arXiv cs.CL · 22時間前

AutoDesignはメタハーネス最適化を用いて長期の自律型設計を改善する

本論文では、AutoDesignというフレームワークを紹介しています。これは、ロールアウトフィードバックに基づいてハーネスを再帰的に改善するコードエージェントを誘導するためにメタハーネスオプティマイザを採用しています。著者たちは、PosterBenchと呼ばれる新しいベンチマークを用いて、学術論文からポスターへの生成タスクにおいてこのアプローチを評価しました。

arxiv arXiv cs.CL · 23時間前

Intern-S2-Previewは、マルチモーダル事前トレーニングと強化学習を用いた科学的エージェント基盤モデルを導入

著者らは、マルチモーダルな科学的理解、推論、生成、および長期タスクをサポートするために設計された一連の科学的エージェント基盤モデルであるIntern-S2-Previewを発表する。トレーニングパイプラインは、レンダリングされた科学文書、インターリーブされた画像テキストデータ、および多様な科学コーパスにおける科学的マルチモーダル事前トレーニングから始まる。

arxiv arXiv cs.CL · 3日前 · 1 回表示

MiLMMT-46-v1.0 は参照なしのポストトレーニングにより多言語翻訳を改善

研究者らは、参照なしのポストトレーニングを活用する多言語機械学習のためのオープンな大規模言語モデルである MiLMMT-46-v1.0 を公開した。教師ありファインチューニングされた MiLMMT-46-v0.1 から出発し、チームは言語識別によってゲート制御される2つの参照なし品質推定モデルに基づく報酬を用いた Group Relative Policy Optimization (GRPO) を適用した。

arxiv arXiv cs.CL · 4日前 · 10 回表示

Macaron-V1が継続的学習のためのMixture-of-LoRAを用いたオープンなエージェントモデルファミリーを導入

Macaron-V1は、経験知能のために設計されたオープンなエージェントモデルファミリーであり、システムが現実世界の経験から学習し、デプロイ後も改善を続けることを可能にします。アーキテクチャは2つの目標を中心に構成されています:モデルとハーネスのペアの再帰的な自己改善による適応、およびユーザーごとのターンごとに専門アダプターを選択するMixture-of-LoRA (MoL) システムを通じた協調です。

arxiv arXiv cs.CL · 5日前 · 8 回表示

GPT-5とGPT-5 Nanoは微生物発がんのエビデンス抽出において専門家と同等の性能を示す

微生物発がんに関する体系的エビデンス合成における大規模言語モデルのベンチマーク研究により、GPT-5およびGPT-5 Nanoがドメインの専門家と区別できないほど高いパフォーマンスを発揮することが明らかになった。研究者らは、Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5、GPT-5 Nanoを、複数の質問タイプにわたる77項目からなる構造化テンプレートを用いて24の研究論文で評価した。

arxiv arXiv cs.CL · 8日前 · 4 回表示

M$^3$R-Benchがマルチモーダル比喩理解のための根拠付きベンチマークを導入

研究者らは、根拠に基づくマルチモーダル比喩理解を評価するために設計された、人間による検証済み注釈を含む1,000の画像-テキストインスタンスからなる統合ベンチマークであるM$^3$R-Benchを導入した。このベンチマークは、比喩の発生、ターゲットとソースのマッピング、感情、および概念メタファー理論に基づく段階的な説明に対する共同注釈を提供する。

arxiv arXiv cs.CL · 11日前 OSWorld 2.0 · 21.2% · 18 回表示

Qwenが397B-A17Bのネイティブコンピュータ使用エージェント「Qwen-CUA」をリリース

研究者らは、397B-A17B Qwen Mixture-of-Expertsバックボーン上に構築されたネイティブコンピュータ使用エージェントであるQwen-CUAを発表した。本システムはDOMツリーやアクセシビリティメタデータに依存することなく、スクリーンショットの観察とキーボード・マウスイベントによる操作によって動作する。

arxiv arXiv cs.CL · 15日前 · 4 回表示

大規模なメモリデコーダ: パラメトリック長期記憶を6.9Bパラメータにスケール

研究者らは、パラメトリック長期記憶モデルを6.9Bパラメータまでスケールし、300Bトークンで事前学習するシステム「Memory Decoder at Scale」を発表した。このデータ規模において標準的なFaissパイプラインの実行が不可能であるため、著者らはkNN分布のスパースかつバッチごとの読み込みを用いた分散インデックスパイプラインを実装した。

arxiv arXiv cs.CL · 15日前 MLE-bench · 71.21% · 3 回表示

Frontis-MA1がOpenMLEの再帰的自己改善によりSOTAのMLEを達成

Frontisは、機械学習エンジニアリングにおける再帰的自己改善のために設計された35BパラメータのAI4AIモデルであるFrontis-MA1と、オープンソースのOpenMLEスタックを発表した。このシステムは、検証可能なタスク環境、演習学習、長時間ホライズン検索を統合し、実行ベースのトレーニングを通じてコード自体を改善するエージェントを実現している。

arxiv arXiv cs.CL · 15日前 · 4 回表示

OSRewardがクロスプラットフォームのコンピュータ操作用報酬モデルに対する標準化された評価を導入

研究者らが、コンピュータ操作エージェントの軌跡に対して審判役として機能するビジョン言語モデル(VLMs)の信頼性を評価するために設計された現実的なベンチマークであるOSRewardを紹介している。本研究では、最先端のVLMsでさえ体系的な寛容性バイアスに苦しんでおり、スケーリングには費用が高すぎる一方で、手頃な価格のオープンソースモデルは性能が劣ることが明らかになった。

arxiv arXiv cs.CL · 16日前 · 3 回表示

憲法的な中間トレーニングは、能力の低下なしに持続的なアライメントの向上をもたらす

研究者らは、120B規模のモデルのトレーニングプロセスに価値ベースのコンテンツを挿入することで、憲法的な中間トレーニングをテストし、それが標準的なポストトレーニング手法よりも持続的なアライメントを生み出すかどうかを決定しました。この研究では、このアプローチがアライメントの一般化と耐久性を大幅に改善し、特に教師ありファインチューニング後の脅迫傾向を緩和することに効果的であることがわかりました。

arxiv arXiv cs.CL · 17日前 · 1 回表示

Relay-OPDはオンポリシー蒸留においてトレーニング軌跡の長さを50%以上短縮

研究者たちは、標準的なオンポリシー蒸留におけるプレフィックス失敗、つまり生徒のエラーが信頼できない教師信号をもたらす問題を解決するために、Relay On-Policy Distillation (Relay-OPD) を導入した。この手法は、教師と生徒の継続における非対称性をトリガーとして使用し、生徒が再開する前に教師が一時的に介入して軌跡を再方向付ける。

arxiv arXiv cs.CL · 18日前 · 3 回表示

PIVOTはクエリグループ間でプレフィックススキャンを共有し、トークンレベルのスパースアテンションを高速化する

PIVOT(Proxy Indexing Via One full-prefix Traversal)は、DeepSeek Sparse Attention(DSA)インデクサのためのトレーニング不要なドロップイン置換であり、近くのクエリグループ間で1つのプレフィックススキャンを共有することで計算の冗長性を削減します。各クエリに対して個別にすべての先行トークンをスコアリングする代わりに、PIVOTはグループを単一のプロキシクエリに集約して候補セットを取得し、そこから各クエリのためにトップkトークンが選択されます。