U-OPSDはLLMのための教師なしオンポリシー自己蒸留を可能にする
研究者らは、外部の監督なしでモデル自身の生成のみを使用して大規模言語モデルのトレーニング後の改善を実現する手法である教師なしオンポリシー自己蒸留(U-OPSD)を提案した。このアプローチは複数のロールアウトをサンプリングして多数決により疑似解を構築し、教師分布をモデルの最長の不正解完了のプレフィックスに蒸留する。
研究者らは、外部の監督なしでモデル自身の生成のみを使用して大規模言語モデルのトレーニング後の改善を実現する手法である教師なしオンポリシー自己蒸留(U-OPSD)を提案した。このアプローチは複数のロールアウトをサンプリングして多数決により疑似解を構築し、教師分布をモデルの最長の不正解完了のプレフィックスに蒸留する。
Appleは第3世代ファウンデーションモデル(AFM3)用の新しいアーキテクチャを導入し、「指示追従プルーニング」を活用してアクティブなパラメータ数を大幅に削減しました。このモデルは、トークンごとではなくプロンプトごとにルーティング判断を行うことで、MLPレイヤーの約20%をアクティブ化するように設計されています。
NVIDIAのNeMoチームは、研究者によるアルゴリズムの反復処理における複雑さを軽減するために設計されたオープンソースのエージェント型強化学習フレームワークであるMoltをリリースした。コードベースは約8.6K行のRLコードで、verl(62K行)やslime(25K行)などの同等のフレームワークと比べて大幅に小さい。
著者は、誤ったツール選択や不正な引数など、失敗したツール使用エージェントのトレースが、これらのエラーからモデルを遠ざけるために貴重なファインチューニングデータとして機能する可能性があるという仮説を提案しています。この投稿は、修正された失敗トレースでのトレーニングが効果的か有害かについて、コミュニティからのフィードバックを求めています。
PIN Architecture v2は、重みの共有を用いて、トレーニング前にニューラルネットワークのサイズと推論速度を事前に選択する方法を導入します。この手法は、セルのグループに同一の値を持たせることで、ネットワークの幅を維持しつつ、保存される重みの数を大幅に削減します。
Huaweiは、AscendハードウェアでトレーニングされたMixture of Experts (MoE)大規模言語モデルであるopenPangu-2.0-Proのオープンソースウェイトを公開しました。このモデルは5050億の総パラメータと180億の活性化パラメータを持ち、512kトークンのコンテキスト長をサポートします。
研究者らは、パラメトリック長期記憶モデルを6.9Bパラメータまでスケールし、300Bトークンで事前学習するシステム「Memory Decoder at Scale」を発表した。このデータ規模において標準的なFaissパイプラインの実行が不可能であるため、著者らはkNN分布のスパースかつバッチごとの読み込みを用いた分散インデックスパイプラインを実装した。
Microsoft Researchは、大規模言語モデルが推論中に正解ラベルや外部フィードバックを必要とせず、自身の経験から学習できるフレームワークであるEvoLibを導入した。EvoLibは、生の経験を静的な記憶として保存するのではなく、再利用可能なスキルや反射的な洞察に変換し、それらを継続的に洗練、統合、再重み付けする。
Microsoft Researchは、コンピュータ使用エージェントのトレーニング用に設計された12の深い合成環境のコレクションであるEchoverseをリリースしました。このイニシアチブには、ドメイン固有の世界10と能力焦点の世界2が含まれており、すべて一貫した状態と行動の忠実度を維持するように構築されています。
研究者たちは、標準的なオンポリシー蒸留におけるプレフィックス失敗、つまり生徒のエラーが信頼できない教師信号をもたらす問題を解決するために、Relay On-Policy Distillation (Relay-OPD) を導入した。この手法は、教師と生徒の継続における非対称性をトリガーとして使用し、生徒が再開する前に教師が一時的に介入して軌跡を再方向付ける。
Googleは現在、そのGeminiモデル向けの蒸留サービスを提供しています。これにより、ユーザーはGoogle Cloudプラットフォームを通じて、大規模なGeminiモデルの機能をより小型で効率的なバージョンに圧縮できます。
OpenForgeRLは、研究者が標準的な強化学習スタックを使用してハーネスベースのAIエージェントをエンドツーエンドで学習できるようにするオープンソースフレームワークです。モデル呼び出しをデータとして記録する軽量プロキシと、リモートコンテナでのロールアウトを管理するKubernetesオーケストレーターを採用することで、学習と推論を分離します。
CrowdTensorは、チェックポイント付きのボランティアモデル訓練キャンペーンのためのApache-2.0オープンソースプロトコルであり、承認されたCPU、GPU、またはTPUセルに有界な作業を提供するために不変のモデルおよびデータ改訂を固定します。このプロジェクトは、Qwen2.5-7B GSM8Kキャンペーンに関する草案RFCとともに、ベータ版登録プロセスをリリースしました。
固定状態の非線形トークンミキサーであるThetaScan v0.1の研究プレビューが、オープンソース実装として公開されました。このアーキテクチャは、各トークンが進化する高速状態ではなく、現在の入力と共有パラメータからメモリの書き込みを計算することを保証し、結合性接頭辞スキャンを通じて書き込みを合成できるようにしています。
研究者らは、Claude CodeやOpenClawといった複雑な推論ハーネスを用いてAIエージェントのエンドツーエンド学習を可能にするオープンソースフレームワークであるOpenForgeRLを発表した。本システムは、モデル呼び出しをデータとして記録する軽量プロキシと、リモートコンテナの展開を管理するKubernetesオーケストレーターを活用することで、学習と推論を分離している。
OpenForgeRLは、研究者が標準的な強化学習スタックを使用してハーネスベースのAIエージェントをエンドツーエンドで学習できるようにするオープンソースフレームワークです。これは、モデル呼び出しをデータとして記録する軽量プロキシと、リモートコンテナの展開を管理するKubernetesオーケストレーターを通じて、学習と推論を分離することで実現されます。
Hugging Faceフォーラムのユーザーが、7B~14Bパラメータ範囲の小型ドメイン特化大規模言語モデル(LLM)が、実際の生産環境においてより大きなモデルを効果的に置き換えられるかどうかを調査しています。
ELIZAチャットボットの新しい実装は、会話エントリを潜在記憶層に格納するためにスパースオートエンコーダアーキテクチャを利用し、従来のキーワードマッチング手法の改善を目指している。このシステムは32,768ニューロンの記憶層を持つT5エンコーダデコーダ構造を採用しており、コントラスト学習によって類似エントリが活性化される。
SLAIは、Ascend SuperPODインフラストラクチャ上のDeepSeek-V4モデルファミリー向けのフルパラメータポストトレーニングフレームワークであるT-Rexを導入しました。このシステムは、階層化最適化を通じて、兆パラメータのMoEモデルにおけるメモリ圧力と通信オーバーヘッドに対処します。
SLAIは、Ascend NPU SuperPOD上で兆規模のパラメータを持つMoEモデルのフルパラメータ後処理のためのエンドツーエンド最適化フレームワークであるT-Rexを導入しました。DeepSeek-V4モデルファミリーを対象ワークロードとして使用し、本システムは階層型並列化とカーネル実行の最適化を通じてメモリ圧力と通信オーバーヘッドに対処しています。