トピック · Training methods
lab Microsoft Research Blog · 15日前 · 7 回表示

Microsoft、コンピュータ使用エージェントのトレーニング用「Echoverse」をリリース

Microsoft Researchは、コンピュータ使用エージェントのトレーニング用に設計された12の深い合成環境のコレクションであるEchoverseをリリースしました。このイニシアチブには、ドメイン固有の世界10と能力焦点の世界2が含まれており、すべて一貫した状態と行動の忠実度を維持するように構築されています。

lab NVIDIA Research · 3日前 · 38 回表示

LLMはハイパーパラメータ最適化においてベイズ最適化と同等かそれを超える

新しい論文では、基礎的な大規模言語モデル(LLM)を使用してハイパーパラメータ最適化(HPO)を自動化することが探られています。このプロセスは通常、限られた予算の状況で手動のアプローチに依存します。著者たちは、LLMがデータセットとモデルの説明に基づいてハイパーパラメータ構成を提案し、それらがモデルのパフォーマンスに応じて反復的に改善される方法論を開発しました。

lab NVIDIA Research · 3日前 · 40 回表示

Sourceがトレーニングデータ属性付けのための近似アンロール微分を導入

研究者は、影響関数の計算効率と展開ベースのアプローチの精度を組み合わせた新しいトレーニングデータ属性付け(TDA)手法であるSourceを紹介する。影響関数に似た公式を使用して展開微分を近似することにより、Sourceは最適化バイアスやマルチステージパイプラインを考慮しないという暗黙的微分手法の制限に対処する。

lab NVIDIA Research · 3日前 · 9 回表示

JacNetは構造化ヤコビアンを直接モデル化することで関数を学習する

本論文では、JacNetというニューラルネットワークアーキテクチャを紹介しています。これは関数そのものではなく、入力-出力関数のヤコビアンを直接学習します。このアプローチにより、微分の性質を精密に制御でき、可逆性やk-Lipschitz連続性などの構造的な事前知識を適用することが可能になります。

lab NVIDIA Research · 3日前 · 12 回表示

jlorraine がディープラーニング用のスケーラブルなネスト最適化ツールを発表

本記事では、大規模なディープラーニング設定にバイレベルまたはネスト最適化を適用する課題に対処する jlorraine の論文を紹介しています。勾配ベースの最適化は通常、単一のパラメータセットを更新しますが、多くのアプリケーションでは、互いにネストされた異なる目的関数に対してパラメータの部分集合を更新する必要があります。

lab NVIDIA Research · 4日前 · 6 回表示

Mastersはマスキング教師と強化学生によりビジョン言語モデルを蒸留する

研究者らは、エッジデプロイメントに適したコンパクトなバージョンに大規模ビジョン言語モデルを蒸留するためのマスクプログレッシブ強化学習フレームワークであるMastersを提案する。この手法は、教師と学生のモデル間のサイズギャップによって引き起こされる不安定性に対処する。

lab NVIDIA Research · 4日前 · 9 回表示

ZPPOは勾配の代わりにプロンプトを使用して、小規模なビジョン言語モデルのトレーニングを改善する

研究者らは、知識蒸留における脆弱性や強化学習におけるドリフトに対処するため、教師の知識をポリシー勾配ではなくプロンプトに注入する方法であるZone of Proximal Policy Optimization (ZPPO) を導入した。ZPPOは、難しい問題に対してBinary Candidate-included Questions (BCQ) とNegative Candidate-included Questions (NCQ) を構築し、学生の精度が向上するか、除外されるまでリプレイバッファを介してそれらを再循環させる。

lab Microsoft Research Blog · 15日前 · 4 回表示

Microsoft Researchが、進化型ライブラリを用いたテスト時学習のためのEvoLibを発表

Microsoft Researchは、大規模言語モデルが推論中に正解ラベルや外部フィードバックを必要とせず、自身の経験から学習できるフレームワークであるEvoLibを導入した。EvoLibは、生の経験を静的な記憶として保存するのではなく、再利用可能なスキルや反射的な洞察に変換し、それらを継続的に洗練、統合、再重み付けする。

media Hugging Face Forums · 1日前 · 1 回表示

ThetaMemは固定状態シーケンスメモリに対して符号付き乗算キーリフトを提案

ThetaMemは、ゲート機構の微調整ではなく、学習された符号付きハダマール積または外積によるキーリフトを通じて再帰的状態を変更する再帰ミクサーの前段階的な単一シード研究である。著者は合成ベンチマークで混合された結果を示し、アプローチを反証できる最もコストの低い実験を特定するために批判を求めることを明確にしている。

media MarkTechPost · 1日前 · 6 回表示

Dyna Roboticsが、100万時間分の人間の動画で事前学習された世界行動モデル「Dyna-2」をリリース

Dyna Roboticsは、100万時間以上の自己中心型人間の動画で事前学習されたロボット操作用の世界行動モデル「Dyna-2」をリリースした。同社は、1,000時間から1,000,000時間へのスケーリング法則を確立することで、通常の人間の動画がアクションラベル付きデータの代用になり得ることを実証している。

arxiv arXiv cs.CL · 3日前 · 1 回表示

MiLMMT-46-v1.0 は参照なしのポストトレーニングにより多言語翻訳を改善

研究者らは、参照なしのポストトレーニングを活用する多言語機械学習のためのオープンな大規模言語モデルである MiLMMT-46-v1.0 を公開した。教師ありファインチューニングされた MiLMMT-46-v0.1 から出発し、チームは言語識別によってゲート制御される2つの参照なし品質推定モデルに基づく報酬を用いた Group Relative Policy Optimization (GRPO) を適用した。

lab Hugging Face Blog · 5日前 · 8 回表示

Multiverse Computingが融合チャンク化KL損失により知識蒸留のVRAMを削減

Multiverse Computingは、オフラインのトップKロジットキャッシングと融合チャンク化カルバック・ライブラ(KL)発散損失を組み合わせることで、大規模言語モデルの知識蒸留に対するメモリ効率の高いアプローチを導入しました。この手法は、教師モデルと生徒モデルを同時にメモリに保持する必要を排除し、VRAM要件を劇的に削減します。

arxiv arXiv cs.LG · 8日前

U-OPSDはLLMのための教師なしオンポリシー自己蒸留を可能にする

研究者らは、外部の監督なしでモデル自身の生成のみを使用して大規模言語モデルのトレーニング後の改善を実現する手法である教師なしオンポリシー自己蒸留(U-OPSD)を提案した。このアプローチは複数のロールアウトをサンプリングして多数決により疑似解を構築し、教師分布をモデルの最長の不正解完了のプレフィックスに蒸留する。

media r/LocalLLaMA · 11日前 · 5 回表示

AppleのAFM3 20Bは指示追従プルーニングを使用して約20%のレイヤーをアクティブ化

Appleは第3世代ファウンデーションモデル(AFM3)用の新しいアーキテクチャを導入し、「指示追従プルーニング」を活用してアクティブなパラメータ数を大幅に削減しました。このモデルは、トークンごとではなくプロンプトごとにルーティング判断を行うことで、MLPレイヤーの約20%をアクティブ化するように設計されています。

media MarkTechPost · 12日前 · 4 回表示

NVIDIA NeMoがコンパクトなPyT-nativeエージェント型RLフレームワーク「Molt」をリリース

NVIDIAのNeMoチームは、研究者によるアルゴリズムの反復処理における複雑さを軽減するために設計されたオープンソースのエージェント型強化学習フレームワークであるMoltをリリースした。コードベースは約8.6K行のRLコードで、verl(62K行)やslime(25K行)などの同等のフレームワークと比べて大幅に小さい。

media Hugging Face Forums · 13日前

失敗したエージェントのトレースをファインチューニングデータとして使用できるかどうかの調査

著者は、誤ったツール選択や不正な引数など、失敗したツール使用エージェントのトレースが、これらのエラーからモデルを遠ざけるために貴重なファインチューニングデータとして機能する可能性があるという仮説を提案しています。この投稿は、修正された失敗トレースでのトレーニングが効果的か有害かについて、コミュニティからのフィードバックを求めています。

media Hugging Face Forums · 14日前 · 3 回表示

PIN v2は重みの共有によりモデル幅とストレージコストを分離する

PIN Architecture v2は、重みの共有を用いて、トレーニング前にニューラルネットワークのサイズと推論速度を事前に選択する方法を導入します。この手法は、セルのグループに同一の値を持たせることで、ネットワークの幅を維持しつつ、保存される重みの数を大幅に削減します。