Microsoft Researchのシステムが米国の66,935箇所の変電所に対する空間天気リスクを予測
Microsoft Researchで開発された機械学習パイプラインは、米国本土の66,935箇所の変電所に対して、場所固有の地磁気誘導電流(GIC)リスク推定値を生成します。このシステムは太陽風予報と地域的な地質データを組み合わせることで、特定のリスクが発生する30〜60分前に電力系統運用者に警告を提供します。
Microsoft Researchで開発された機械学習パイプラインは、米国本土の66,935箇所の変電所に対して、場所固有の地磁気誘導電流(GIC)リスク推定値を生成します。このシステムは太陽風予報と地域的な地質データを組み合わせることで、特定のリスクが発生する30〜60分前に電力系統運用者に警告を提供します。
研究者らは、モデルのコンテキストウィンドウを編集可能なファイルとして扱う新しいアーキテクチャであるコンテキスト言語モデル(CLM)を発表した。これにより、モデルは自身のメモリに対して制限のない更新を行うことができる。このアプローチは、コンテキスト管理を外部の制御からモデルの内在的な動作へと移行させ、コンテキスト内の学習とパラメトリックな学習の両方を通じてコンテキスト管理戦略を実現可能にする。
研究者らは、Retrospection-Only Fine-Tuning (ROFT) を調査している。これはエージェントが自身の経験の回顧的説明を生成し、その説明トークンにおける次のトークン予測損失のみを使用してファインチューニングされる最小限のオンライン手順である。この手法には外部教師や報酬ベースのポリシー更新は必要ない。
ロジットベースの知識蒸留に関する探索的研究を共有している研究者は、コミュニティに対して現実世界の産業経験とエンジニアリングの洞察を求めています。
VHD-Playは、数学的モデルのサンプリングと求解を経て、その意思決定プロセスを状態保持ツールとしてレンダリングすることで、多様な自律型強化学習環境を生成するパイプラインである。このアプローチにより、実行可能なダイナミクスや軌道スコアリングの参照が解決済みモデルから直接継承され、既存のパイプラインで一般的にみられる不整合の問題に対処する。
研究者らは、人間が記述したエージェントのスキルを実行可能で検証可能なトレーニング環境に変換するフレームワーク「SkillGym」を発表した。このシステムは、スキルからタスクへのパイプラインを活用して具体的なタスクをインスタンス化し、コードベースのチェッカーによって結果を検証する。
Together AIは、Qwen3.5 4Bベースモデルを使用してJevに似た分類モデルをファインチューニングするためのガイドとオープンソースリポジトリをリリースしました。
NVIDIA Warpを基盤とするMuJoCo Warp(MJWarp)は、互換性のあるMuJoCoモデルをGPUスケールで実行可能にし、1回の呼び出しで数百または数千の独立したシミュレーションワールドの展開を可能にします。このアーキテクチャは、単一の環境に対するレイテンシー最小化から集約スループットの向上へと焦点を移し、強化学習や大規模サンプリングに有利なものです。
SplitMoEは、トークン表現の柔軟性と計算モジュール性を向上させるために、幅広いフィードフォワード層をより小さく専門的なサブコンポーネントに分解する代替のMixture of Expertsアーキテクチャです。
ワールドステートジェネレーター(WSG)は、失敗後に状態を書き換えることで、言語エージェントの計画を実行環境のルールに合わせ続けるモデルです。プログラムがルールを強制し目標到達可能性を検証する7つの合成ドメインから抽出された226Kの軌道で訓練されています。
著者は、診断および臨床ヘルスケアの推論を強化するために合成データとルーブリックベースの強化学習を使用する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまず、診断のためにMedBullets由来の質問にルール誘導型RLを適用し、その後、対話型臨床タスクのために多次元ルーブリックを持つ5.3kの合成マルチターンシナリオを利用します。
Jen Wei は、今後の PyTorch Conference の講演に向けて OLMo-core 内で AdamW、Muon、および最新の Dion3 実装をテストしている際に、学習率のデススパイラルに遭遇しました。
著者は、合成データとルーブリックベースの強化学習を使用して、診断および臨床医療の推論の両方を強化する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまずMedBullets由来の質問を使用して診断精度を対象とし、その後多次元ルーブリックを持つ5.3kの生成シナリオを通じてマルチターン臨床対話を扱います。
著者らは、合成データとルーブリックベースの強化学習を用いて、診断および臨床医療の推論の両方を強化する 30B パラメータのモデル Fathom-Vaidya を紹介しています。
TypeSafe AIは、生産環境向けに設計された新しいクラスの「System One」モデルであるJevをリリースした。同社のCEOでありInstructGPT論文の共著者であるDiogo Almeidaは、現在の最先端モデルが信頼性よりもアライメントと拒否を優先してきた結果、ハルシネーションや迎合主義といった問題が生じていると指摘している。
MB-Bidramは、推論能力と知識の記憶を分離するように設計されたWideNDepth(WND)という実験的なニューラルアーキテクチャをリリースしました。モデルはメモリとして機能する「Wide部分」と推論者として機能する「Depth部分」で構成されています。
Hugging Faceでの提案は、AIにおける2つの相互に関連する問題について議論しています:個別の大規模モデルのトレーニングへの依存と、エコシステムが汎用GPUに依存していることです。
Hugging Faceフォーラムのユーザーが、段階的知識転送の実験を提案しています。この手法では、固定サイズの生徒モデル(Qwen 4B)が、最大の利用可能なモデルから直接学ぶのではなく、より大きな教師モデルから順次学習します。
OpenAIは、そのモデルにおけるミスマッチを追跡、調査、および開示するための新しいフレームワークを導入し、強化学習トレーニングからの6件の詳細なインシデントレポートを伴った。このシステムは、公的な開示のための具体的な基準と期限を設定しており、行動が完全に説明されていないか緩和されていない場合でも適用される。
ByteLexの研究チームは、11のトークナイザー語彙から座標空間を構築し、バイトレベル言語モデルがどの架空の単語で失敗するかを予測しました。このマップは、モデルの測定された単語ごとの精度と-0.98のスピアマン相関を示し、コーパス由来の統計情報を上回りました。