Training methods
arxiv arXiv cs.LG · 2日前

U-OPSDはLLMのための教師なしオンポリシー自己蒸留を可能にする

研究者らは、外部の監督なしでモデル自身の生成のみを使用して大規模言語モデルのトレーニング後の改善を実現する手法である教師なしオンポリシー自己蒸留(U-OPSD)を提案した。このアプローチは複数のロールアウトをサンプリングして多数決により疑似解を構築し、教師分布をモデルの最長の不正解完了のプレフィックスに蒸留する。

media r/LocalLLaMA · 5日前

AppleのAFM3 20Bは指示追従プルーニングを使用して約20%のレイヤーをアクティブ化

Appleは第3世代ファウンデーションモデル(AFM3)用の新しいアーキテクチャを導入し、「指示追従プルーニング」を活用してアクティブなパラメータ数を大幅に削減しました。このモデルは、トークンごとではなくプロンプトごとにルーティング判断を行うことで、MLPレイヤーの約20%をアクティブ化するように設計されています。

media MarkTechPost · 7日前 · 4 回表示

NVIDIA NeMoがコンパクトなPyT-nativeエージェント型RLフレームワーク「Molt」をリリース

NVIDIAのNeMoチームは、研究者によるアルゴリズムの反復処理における複雑さを軽減するために設計されたオープンソースのエージェント型強化学習フレームワークであるMoltをリリースした。コードベースは約8.6K行のRLコードで、verl(62K行)やslime(25K行)などの同等のフレームワークと比べて大幅に小さい。

media Hugging Face Forums · 8日前

失敗したエージェントのトレースをファインチューニングデータとして使用できるかどうかの調査

著者は、誤ったツール選択や不正な引数など、失敗したツール使用エージェントのトレースが、これらのエラーからモデルを遠ざけるために貴重なファインチューニングデータとして機能する可能性があるという仮説を提案しています。この投稿は、修正された失敗トレースでのトレーニングが効果的か有害かについて、コミュニティからのフィードバックを求めています。

arxiv arXiv cs.CL · 9日前 · 2 回表示

大規模なメモリデコーダ: パラメトリック長期記憶を6.9Bパラメータにスケール

研究者らは、パラメトリック長期記憶モデルを6.9Bパラメータまでスケールし、300Bトークンで事前学習するシステム「Memory Decoder at Scale」を発表した。このデータ規模において標準的なFaissパイプラインの実行が不可能であるため、著者らはkNN分布のスパースかつバッチごとの読み込みを用いた分散インデックスパイプラインを実装した。

lab Microsoft Research Blog · 9日前 · 3 回表示

Microsoft Researchが、進化型ライブラリを用いたテスト時学習のためのEvoLibを発表

Microsoft Researchは、大規模言語モデルが推論中に正解ラベルや外部フィードバックを必要とせず、自身の経験から学習できるフレームワークであるEvoLibを導入した。EvoLibは、生の経験を静的な記憶として保存するのではなく、再利用可能なスキルや反射的な洞察に変換し、それらを継続的に洗練、統合、再重み付けする。

lab Microsoft Research Blog · 9日前 · 4 回表示

Microsoft、コンピュータ使用エージェントのトレーニング用「Echoverse」をリリース

Microsoft Researchは、コンピュータ使用エージェントのトレーニング用に設計された12の深い合成環境のコレクションであるEchoverseをリリースしました。このイニシアチブには、ドメイン固有の世界10と能力焦点の世界2が含まれており、すべて一貫した状態と行動の忠実度を維持するように構築されています。

arxiv arXiv cs.CL · 11日前

Relay-OPDはオンポリシー蒸留においてトレーニング軌跡の長さを50%以上短縮

研究者たちは、標準的なオンポリシー蒸留におけるプレフィックス失敗、つまり生徒のエラーが信頼できない教師信号をもたらす問題を解決するために、Relay On-Policy Distillation (Relay-OPD) を導入した。この手法は、教師と生徒の継続における非対称性をトリガーとして使用し、生徒が再開する前に教師が一時的に介入して軌跡を再方向付ける。

arxiv arXiv cs.CL · 13日前 OSWorld · 37.7%

OpenForgeRLは、あらゆる環境でハーネスベースのエージェントのエンドツーエンド学習を可能にする

OpenForgeRLは、研究者が標準的な強化学習スタックを使用してハーネスベースのAIエージェントをエンドツーエンドで学習できるようにするオープンソースフレームワークです。モデル呼び出しをデータとして記録する軽量プロキシと、リモートコンテナでのロールアウトを管理するKubernetesオーケストレーターを採用することで、学習と推論を分離します。

media Hugging Face Forums · 14日前 GSM8K · 74.22%

CrowdTensorがボランティア訓練ベータ版とQwen2.5-7B GSM8Kキャンペーン草案RFCをリリース

CrowdTensorは、チェックポイント付きのボランティアモデル訓練キャンペーンのためのApache-2.0オープンソースプロトコルであり、承認されたCPU、GPU、またはTPUセルに有界な作業を提供するために不変のモデルおよびデータ改訂を固定します。このプロジェクトは、Qwen2.5-7B GSM8Kキャンペーンに関する草案RFCとともに、ベータ版登録プロセスをリリースしました。

media Hugging Face Forums · 15日前

ThetaScan v0.1が17Mの言語モデル結果を備えたオープンなスキャン並列非線形メモリをリリース

固定状態の非線形トークンミキサーであるThetaScan v0.1の研究プレビューが、オープンソース実装として公開されました。このアーキテクチャは、各トークンが進化する高速状態ではなく、現在の入力と共有パラメータからメモリの書き込みを計算することを保証し、結合性接頭辞スキャンを通じて書き込みを合成できるようにしています。

arxiv arXiv cs.CL · 16日前 SWE-bench Pro · 55.9% · 2 回表示

OpenForgeRLは、あらゆる環境でのハーネスベースエージェントのエンドツーエンド学習を可能にする

研究者らは、Claude CodeやOpenClawといった複雑な推論ハーネスを用いてAIエージェントのエンドツーエンド学習を可能にするオープンソースフレームワークであるOpenForgeRLを発表した。本システムは、モデル呼び出しをデータとして記録する軽量プロキシと、リモートコンテナの展開を管理するKubernetesオーケストレーターを活用することで、学習と推論を分離している。

arxiv arXiv cs.AI · 16日前 OSWorld · 37.7% · 5 回表示

OpenForgeRLは、あらゆる環境でハーネスベースのエージェントのエンドツーエンド学習を可能にする

OpenForgeRLは、研究者が標準的な強化学習スタックを使用してハーネスベースのAIエージェントをエンドツーエンドで学習できるようにするオープンソースフレームワークです。これは、モデル呼び出しをデータとして記録する軽量プロキシと、リモートコンテナの展開を管理するKubernetesオーケストレーターを通じて、学習と推論を分離することで実現されます。

media Hugging Face Forums · 17日前

スパースオートエンコーダを用いたELIZA

ELIZAチャットボットの新しい実装は、会話エントリを潜在記憶層に格納するためにスパースオートエンコーダアーキテクチャを利用し、従来のキーワードマッチング手法の改善を目指している。このシステムは32,768ニューロンの記憶層を持つT5エンコーダデコーダ構造を採用しており、コントラスト学習によって類似エントリが活性化される。

media r/LocalLLaMA · 17日前 · 1 回表示

SLAI T-RexがAscend上でDeepSeek-V4に対して34.22% MFUおよび71.81% Pass@1を達成

SLAIは、Ascend SuperPODインフラストラクチャ上のDeepSeek-V4モデルファミリー向けのフルパラメータポストトレーニングフレームワークであるT-Rexを導入しました。このシステムは、階層化最適化を通じて、兆パラメータのMoEモデルにおけるメモリ圧力と通信オーバーヘッドに対処します。

arxiv arXiv cs.AI · 17日前 · 4 回表示

SLAIのT-RexがAscend SuperPOD上でDeepSeek-V4のフルパラメータ後処理を可能にする

SLAIは、Ascend NPU SuperPOD上で兆規模のパラメータを持つMoEモデルのフルパラメータ後処理のためのエンドツーエンド最適化フレームワークであるT-Rexを導入しました。DeepSeek-V4モデルファミリーを対象ワークロードとして使用し、本システムは階層型並列化とカーネル実行の最適化を通じてメモリ圧力と通信オーバーヘッドに対処しています。