SplitMoEはパラメータの冗長性を減らすための細粒度の専門家ルーティングを導入
SplitMoEは、トークン表現の柔軟性と計算モジュール性を向上させるために、幅広いフィードフォワード層をより小さく専門的なサブコンポーネントに分解する代替のMixture of Expertsアーキテクチャです。
SplitMoEは、トークン表現の柔軟性と計算モジュール性を向上させるために、幅広いフィードフォワード層をより小さく専門的なサブコンポーネントに分解する代替のMixture of Expertsアーキテクチャです。
ワールドステートジェネレーター(WSG)は、失敗後に状態を書き換えることで、言語エージェントの計画を実行環境のルールに合わせ続けるモデルです。プログラムがルールを強制し目標到達可能性を検証する7つの合成ドメインから抽出された226Kの軌道で訓練されています。
著者は、診断および臨床ヘルスケアの推論を強化するために合成データとルーブリックベースの強化学習を使用する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまず、診断のためにMedBullets由来の質問にルール誘導型RLを適用し、その後、対話型臨床タスクのために多次元ルーブリックを持つ5.3kの合成マルチターンシナリオを利用します。
Jen Wei は、今後の PyTorch Conference の講演に向けて OLMo-core 内で AdamW、Muon、および最新の Dion3 実装をテストしている際に、学習率のデススパイラルに遭遇しました。
著者は、合成データとルーブリックベースの強化学習を使用して、診断および臨床医療の推論の両方を強化する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまずMedBullets由来の質問を使用して診断精度を対象とし、その後多次元ルーブリックを持つ5.3kの生成シナリオを通じてマルチターン臨床対話を扱います。
著者らは、合成データとルーブリックベースの強化学習を用いて、診断および臨床医療の推論の両方を強化する 30B パラメータのモデル Fathom-Vaidya を紹介しています。
TypeSafe AIは、生産環境向けに設計された新しいクラスの「System One」モデルであるJevをリリースした。同社のCEOでありInstructGPT論文の共著者であるDiogo Almeidaは、現在の最先端モデルが信頼性よりもアライメントと拒否を優先してきた結果、ハルシネーションや迎合主義といった問題が生じていると指摘している。
MB-Bidramは、推論能力と知識の記憶を分離するように設計されたWideNDepth(WND)という実験的なニューラルアーキテクチャをリリースしました。モデルはメモリとして機能する「Wide部分」と推論者として機能する「Depth部分」で構成されています。
Hugging Faceでの提案は、AIにおける2つの相互に関連する問題について議論しています:個別の大規模モデルのトレーニングへの依存と、エコシステムが汎用GPUに依存していることです。
Hugging Faceフォーラムのユーザーが、段階的知識転送の実験を提案しています。この手法では、固定サイズの生徒モデル(Qwen 4B)が、最大の利用可能なモデルから直接学ぶのではなく、より大きな教師モデルから順次学習します。
OpenAIは、そのモデルにおけるミスマッチを追跡、調査、および開示するための新しいフレームワークを導入し、強化学習トレーニングからの6件の詳細なインシデントレポートを伴った。このシステムは、公的な開示のための具体的な基準と期限を設定しており、行動が完全に説明されていないか緩和されていない場合でも適用される。
ByteLexの研究チームは、11のトークナイザー語彙から座標空間を構築し、バイトレベル言語モデルがどの架空の単語で失敗するかを予測しました。このマップは、モデルの測定された単語ごとの精度と-0.98のスピアマン相関を示し、コーパス由来の統計情報を上回りました。
OpenAIは、トレーニング中のすべての操作が異種のコモディティハードウェア上でビット単位の確実性をもって独立して再現可能である体制下で訓練された言語モデル「Open-1B」をリリースしました。このアプローチは、GPUカーネルの縮約やデータバッチの順序付けなどの非決定性の原因に対して明確な順序を課すことで、オープンソースモデルに内在する再現性の問題を解決します。
TRL v1.14は、AsyncGRPOTrainerにLoRAサポートを導入し、低ランク適応アダプタのトレーニングと、その小さなファイルのみをvLLM推論ワーカーへの同期を可能にします。このアーキテクチャは、共有ストレージバケットをファイルシステムブリッジとして使用することで、別々のマシン上のトレーニングジョブと生成ジョブを分離し、ノード間のNCCLや直接ネットワーク通信の必要性を排除します。
ユーザー pop123-ux は、高レベルの抽象化を段階的に除去することで Hugging Face スタックを理解するのを支援するために設計された 38 の実行可能なノートブックを含む学習リポジトリを公開しました。コレクションは、transformers や tokenizers などのコアコンポーネントからファインチューニング、PEFT、推論/RL、エンドツーエンドのプロジェクト作業に至るまでのパスをカバーしています。
Together AIは、GLM-5.3やKimi K2.7を含むより広範なオープンウェイトモデルをサポートするようファインチューニングサービスを拡大し、リアルタイムの実験追跡とトレーニングプロセスに対するより細かな制御を導入した。
Googleおよび複数の日本の大学からの研究者が、従来のツール利用データセット生成パイプラインを逆転させたフレームワークであるToolGradを発表した。これはまず検証済みのAPIチェーンを構築し、その後でそれに対応するユーザークエリを作成するというアプローチを取る。この手法は、エージェントの探索中に頻繁に失敗するクエリファースト方式の非効率性を排除することを目指している。
研究者たちは、テスト検証修正の枠組みと役割固有の強化学習を組み合わせてコーディングエージェントを強化するフレームワークであるExecCriticを紹介している。このシステムは、テスト構築とソースコードの修正を分離し、リポジトリネイティブなテストを生成するためにTestエージェントを用い、実行フィードバックに基づいてコードを書き直すためにRepairエージェントを用いる。
memauditは、プライベートデータ上でモデルのファインチューニングが記憶につながったかどうかを検証するためにTRLライブラリと連携するツールです。これは、データセットに補正されたデコイシークレットを注入し、トレーニングプロセス中の損失を追跡することで機能します。
デモンストレーションでは、ガイドテキストからのキーバリュー (KV) 状態を凍結させることで、Qwen2.5-3B-Instruct モデルがガイドをライブプロンプトに含めることなく新しい指示を適用できることが示されています。この手法は、モデルに対してガイドを一度実行し、その KV キャッシュを凍結してから、その隠れたプレフィックスの上に応答を生成することを含みます。