Training methods
arxiv arXiv cs.AI · 22時間前 · 11 回表示

ワールドステートジェネレーターは合成世界と計画を整合させ、エージェントの成功率を向上させる

ワールドステートジェネレーター(WSG)は、失敗後に状態を書き換えることで、言語エージェントの計画を実行環境のルールに合わせ続けるモデルです。プログラムがルールを強制し目標到達可能性を検証する7つの合成ドメインから抽出された226Kの軌道で訓練されています。

arxiv arXiv cs.LG · 1日前 HealthBench · 50.1% · 10 回表示

Fathom-Vaidya、ルーブリックベースの報酬で医療推論を改善

著者は、診断および臨床ヘルスケアの推論を強化するために合成データとルーブリックベースの強化学習を使用する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまず、診断のためにMedBullets由来の質問にルール誘導型RLを適用し、その後、対話型臨床タスクのために多次元ルーブリックを持つ5.3kの合成マルチターンシナリオを利用します。

arxiv arXiv cs.AI · 1日前 HealthBench · 50.1% · 12 回表示

Fathom-Vaidyaはルーブリックベースの報酬で医療推論を改善

著者は、合成データとルーブリックベースの強化学習を使用して、診断および臨床医療の推論の両方を強化する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまずMedBullets由来の質問を使用して診断精度を対象とし、その後多次元ルーブリックを持つ5.3kの生成シナリオを通じてマルチターン臨床対話を扱います。

media Latent Space · 1日前 · 13 回表示

TypeSafe AIが、補正された意思決定のための強化学習で訓練されたSystem Oneモデル「Jev」を発表

TypeSafe AIは、生産環境向けに設計された新しいクラスの「System One」モデルであるJevをリリースした。同社のCEOでありInstructGPT論文の共著者であるDiogo Almeidaは、現在の最先端モデルが信頼性よりもアライメントと拒否を優先してきた結果、ハルシネーションや迎合主義といった問題が生じていると指摘している。

media MarkTechPost · 6日前 · 20 回表示

OpenAI、モデルのミスマッチ開示フレームワークを3つのレビュートラック付きで公開

OpenAIは、そのモデルにおけるミスマッチを追跡、調査、および開示するための新しいフレームワークを導入し、強化学習トレーニングからの6件の詳細なインシデントレポートを伴った。このシステムは、公的な開示のための具体的な基準と期限を設定しており、行動が完全に説明されていないか緩和されていない場合でも適用される。

media Hugging Face Forums · 7日前 · 15 回表示

ByteLexはトークナイザーマップを使用してバイトモデルの誤りを予測・修正

ByteLexの研究チームは、11のトークナイザー語彙から座標空間を構築し、バイトレベル言語モデルがどの架空の単語で失敗するかを予測しました。このマップは、モデルの測定された単語ごとの精度と-0.98のスピアマン相関を示し、コーパス由来の統計情報を上回りました。

arxiv arXiv cs.LG · 7日前 · 20 回表示

OpenAI、完全に監査可能なトレーニング実行でOpen-1Bをリリース

OpenAIは、トレーニング中のすべての操作が異種のコモディティハードウェア上でビット単位の確実性をもって独立して再現可能である体制下で訓練された言語モデル「Open-1B」をリリースしました。このアプローチは、GPUカーネルの縮約やデータバッチの順序付けなどの非決定性の原因に対して明確な順序を課すことで、オープンソースモデルに内在する再現性の問題を解決します。

lab Hugging Face Blog · 9日前 · 16 回表示

TRL v1.14のAsyncGRPOTrainerがHugging Face Jobs間でLoRAのみを同期可能に

TRL v1.14は、AsyncGRPOTrainerにLoRAサポートを導入し、低ランク適応アダプタのトレーニングと、その小さなファイルのみをvLLM推論ワーカーへの同期を可能にします。このアーキテクチャは、共有ストレージバケットをファイルシステムブリッジとして使用することで、別々のマシン上のトレーニングジョブと生成ジョブを分離し、ノード間のNCCLや直接ネットワーク通信の必要性を排除します。

media Hugging Face Forums · 11日前 · 16 回表示

pop123-ux が抽象化を除去して Hugging Face を学ぶための 38 の実行可能ノートブックをリリース

ユーザー pop123-ux は、高レベルの抽象化を段階的に除去することで Hugging Face スタックを理解するのを支援するために設計された 38 の実行可能なノートブックを含む学習リポジトリを公開しました。コレクションは、transformers や tokenizers などのコアコンポーネントからファインチューニング、PEFT、推論/RL、エンドツーエンドのプロジェクト作業に至るまでのパスをカバーしています。

media Together AI Blog · 12日前 Terminal-Bench 2 · 88.2% · 30 回表示

Together AIがエキスパートLoRA、リアルタイムメトリクス、価格引き下げでファインチューニングを拡張

Together AIは、GLM-5.3やKimi K2.7を含むより広範なオープンウェイトモデルをサポートするようファインチューニングサービスを拡大し、リアルタイムの実験追跡とトレーニングプロセスに対するより細かな制御を導入した。

media MarkTechPost · 12日前 Berkeley Function-Calling Leaderboard · 83.2% · 18 回表示

Google Research、ツール利用データ生成フレームワーク「ToolGrad」をリリース

Googleおよび複数の日本の大学からの研究者が、従来のツール利用データセット生成パイプラインを逆転させたフレームワークであるToolGradを発表した。これはまず検証済みのAPIチェーンを構築し、その後でそれに対応するユーザークエリを作成するというアプローチを取る。この手法は、エージェントの探索中に頻繁に失敗するクエリファースト方式の非効率性を排除することを目指している。

arxiv arXiv cs.CL · 14日前 SWE-bench Verified · 72.6% · 25 回表示

ExecCriticは役割固有のRLを用いてテスト誘導型修正によりコーディングエージェントを改善する

研究者たちは、テスト検証修正の枠組みと役割固有の強化学習を組み合わせてコーディングエージェントを強化するフレームワークであるExecCriticを紹介している。このシステムは、テスト構築とソースコードの修正を分離し、リポジトリネイティブなテストを生成するためにTestエージェントを用い、実行フィードバックに基づいてコードを書き直すためにRepairエージェントを用いる。

media Hugging Face Forums · 16日前 · 15 回表示

memauditはSFTトレーニング中の記憶を監査するためにデコイを注入する

memauditは、プライベートデータ上でモデルのファインチューニングが記憶につながったかどうかを検証するためにTRLライブラリと連携するツールです。これは、データセットに補正されたデコイシークレットを注入し、トレーニングプロセス中の損失を追跡することで機能します。

media Hugging Face Forums · 16日前 · 18 回表示

KV Graft Steering は KV 状態を凍結することで概念を転送する

デモンストレーションでは、ガイドテキストからのキーバリュー (KV) 状態を凍結させることで、Qwen2.5-3B-Instruct モデルがガイドをライブプロンプトに含めることなく新しい指示を適用できることが示されています。この手法は、モデルに対してガイドを一度実行し、その KV キャッシュを凍結してから、その隠れたプレフィックスの上に応答を生成することを含みます。