トピック · Training methods
lab Microsoft Research Blog · たった今 ライブ

Microsoft Researchのシステムが米国の66,935箇所の変電所に対する空間天気リスクを予測

Microsoft Researchで開発された機械学習パイプラインは、米国本土の66,935箇所の変電所に対して、場所固有の地磁気誘導電流(GIC)リスク推定値を生成します。このシステムは太陽風予報と地域的な地質データを組み合わせることで、特定のリスクが発生する30〜60分前に電力系統運用者に警告を提供します。

arxiv arXiv cs.CL · 17時間前 · 1 回表示

コンテキスト言語モデルはコンテキストをネイティブに編集可能なファイルとして管理する

研究者らは、モデルのコンテキストウィンドウを編集可能なファイルとして扱う新しいアーキテクチャであるコンテキスト言語モデル(CLM)を発表した。これにより、モデルは自身のメモリに対して制限のない更新を行うことができる。このアプローチは、コンテキスト管理を外部の制御からモデルの内在的な動作へと移行させ、コンテキスト内の学習とパラメトリックな学習の両方を通じてコンテキスト管理戦略を実現可能にする。

arxiv arXiv cs.CL · 2日前 SWE-bench Verified · 49.2% · 1 回表示

ROFTは自己生成された説明でのファインチューニングによりエージェントモデルを改善する

研究者らは、Retrospection-Only Fine-Tuning (ROFT) を調査している。これはエージェントが自身の経験の回顧的説明を生成し、その説明トークンにおける次のトークン予測損失のみを使用してファインチューニングされる最小限のオンライン手順である。この手法には外部教師や報酬ベースのポリシー更新は必要ない。

arxiv arXiv cs.CL · 7日前 · 8 回表示

VHD-Playは解決されたメカニズムから自律型RL環境を生成する

VHD-Playは、数学的モデルのサンプリングと求解を経て、その意思決定プロセスを状態保持ツールとしてレンダリングすることで、多様な自律型強化学習環境を生成するパイプラインである。このアプローチにより、実行可能なダイナミクスや軌道スコアリングの参照が解決済みモデルから直接継承され、既存のパイプラインで一般的にみられる不整合の問題に対処する。

arxiv arXiv cs.CL · 7日前 SWE-Lancer · 51.47% · 10 回表示

SkillGymが人間のスキルをLLMに内部化し、現実世界の問題解決を実現

研究者らは、人間が記述したエージェントのスキルを実行可能で検証可能なトレーニング環境に変換するフレームワーク「SkillGym」を発表した。このシステムは、スキルからタスクへのパイプラインを活用して具体的なタスクをインスタンス化し、コードベースのチェッカーによって結果を検証する。

lab Hugging Face Blog · 7日前 · 16 回表示

NVIDIA WarpとMjWarpがGPU加速の並列ロボティクスシミュレーションを実現

NVIDIA Warpを基盤とするMuJoCo Warp(MJWarp)は、互換性のあるMuJoCoモデルをGPUスケールで実行可能にし、1回の呼び出しで数百または数千の独立したシミュレーションワールドの展開を可能にします。このアーキテクチャは、単一の環境に対するレイテンシー最小化から集約スループットの向上へと焦点を移し、強化学習や大規模サンプリングに有利なものです。

arxiv arXiv cs.AI · 8日前 · 17 回表示

ワールドステートジェネレーターは合成世界と計画を整合させ、エージェントの成功率を向上させる

ワールドステートジェネレーター(WSG)は、失敗後に状態を書き換えることで、言語エージェントの計画を実行環境のルールに合わせ続けるモデルです。プログラムがルールを強制し目標到達可能性を検証する7つの合成ドメインから抽出された226Kの軌道で訓練されています。

arxiv arXiv cs.LG · 9日前 HealthBench · 50.1% · 13 回表示

Fathom-Vaidya、ルーブリックベースの報酬で医療推論を改善

著者は、診断および臨床ヘルスケアの推論を強化するために合成データとルーブリックベースの強化学習を使用する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまず、診断のためにMedBullets由来の質問にルール誘導型RLを適用し、その後、対話型臨床タスクのために多次元ルーブリックを持つ5.3kの合成マルチターンシナリオを利用します。

arxiv arXiv cs.AI · 9日前 HealthBench · 50.1% · 16 回表示

Fathom-Vaidyaはルーブリックベースの報酬で医療推論を改善

著者は、合成データとルーブリックベースの強化学習を使用して、診断および臨床医療の推論の両方を強化する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまずMedBullets由来の質問を使用して診断精度を対象とし、その後多次元ルーブリックを持つ5.3kの生成シナリオを通じてマルチターン臨床対話を扱います。

media Latent Space · 9日前 · 22 回表示

TypeSafe AIが、補正された意思決定のための強化学習で訓練されたSystem Oneモデル「Jev」を発表

TypeSafe AIは、生産環境向けに設計された新しいクラスの「System One」モデルであるJevをリリースした。同社のCEOでありInstructGPT論文の共著者であるDiogo Almeidaは、現在の最先端モデルが信頼性よりもアライメントと拒否を優先してきた結果、ハルシネーションや迎合主義といった問題が生じていると指摘している。

media MarkTechPost · 13日前 · 23 回表示

OpenAI、モデルのミスマッチ開示フレームワークを3つのレビュートラック付きで公開

OpenAIは、そのモデルにおけるミスマッチを追跡、調査、および開示するための新しいフレームワークを導入し、強化学習トレーニングからの6件の詳細なインシデントレポートを伴った。このシステムは、公的な開示のための具体的な基準と期限を設定しており、行動が完全に説明されていないか緩和されていない場合でも適用される。

media Hugging Face Forums · 14日前 · 21 回表示

ByteLexはトークナイザーマップを使用してバイトモデルの誤りを予測・修正

ByteLexの研究チームは、11のトークナイザー語彙から座標空間を構築し、バイトレベル言語モデルがどの架空の単語で失敗するかを予測しました。このマップは、モデルの測定された単語ごとの精度と-0.98のスピアマン相関を示し、コーパス由来の統計情報を上回りました。