Research paper
arxiv arXiv cs.AI · 2時間前 · 9 回表示

AIDE^2がAI研究エージェントの再帰的自己改善を可能にする

研究者らは、AIDE^2を発表した。これは、自身のコードを最適化することで、AI研究エージェントに対する再帰的自己改善のループを実装するシステムである。このシステムは内部ロジックへの変更を提案し、AI R&Dタスクで修正されたバージョンをベンチマークし、隠れた評価で最高のパフォーマンスを発揮したものだけを保持する。

arxiv arXiv cs.AI · 3時間前 WebArena · 45.3% · 13 回表示

Growing Harnessは失敗誘導型学習により、反復的なエージェント制御を再利用可能なコードに変換する

著者らはGrowing Harnessを紹介する。これは標準的な文脈依存のハッスルに頼るのではなく、タスクフィードバックからエージェントの制御構造を学習するトレーニングパラダイムである。反復的な制御判断を実行可能なコードに変換し、意味的推論のためにLLM呼び出しを予約することで、再利用可能な専門エージェントの作成を目指す。

arxiv arXiv cs.LG · 4時間前 · 11 回表示

AIDE^2がAI研究エージェントの再帰的自己改善を可能にする

研究者らは、AIDE^2を発表した。これは、フロントティアAI研究エージェントの再帰的自己改善のループを実装するシステムであり、自身のコードを最適化することで実現される。このシステムは内部ロジックへの変更を提案し、変更されたバージョンをAI R&Dタスクでベンチマークし、隠れた評価で最高のパフォーマンスを示す更新のみを保持する。

arxiv arXiv cs.CL · 7時間前 · 11 回表示

TelecomGPT-R1: 異種テレコムタスクにわたる推論のための統一後学習

研究者らは、TelecomGPT-R1を発表した。これは、規格、構成、ログに対する推論を通じてエンジニアリングタスクを自動化するために設計された、オープンソースの統一型テレコム推論モデルファミリーである。このモデルは、プロトコル、知識、モデリング、障害の各軸をカバーする構造化アプローチを通じて、既存の汎用および専門的なLLMの制限に対処する。

arxiv arXiv cs.LG · 1日前 HealthBench · 50.1% · 10 回表示

Fathom-Vaidya、ルーブリックベースの報酬で医療推論を改善

著者は、診断および臨床ヘルスケアの推論を強化するために合成データとルーブリックベースの強化学習を使用する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまず、診断のためにMedBullets由来の質問にルール誘導型RLを適用し、その後、対話型臨床タスクのために多次元ルーブリックを持つ5.3kの合成マルチターンシナリオを利用します。

arxiv arXiv cs.AI · 1日前 HealthBench · 50.1% · 12 回表示

Fathom-Vaidyaはルーブリックベースの報酬で医療推論を改善

著者は、合成データとルーブリックベースの強化学習を使用して、診断および臨床医療の推論の両方を強化する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまずMedBullets由来の質問を使用して診断精度を対象とし、その後多次元ルーブリックを持つ5.3kの生成シナリオを通じてマルチターン臨床対話を扱います。

lab Microsoft Research Blog · 2日前 · 29 回表示

Microsoft、逆合成予測用のRetroChimeraをリリース

Microsoft Researchは、逆合成予測のための新しいフレームワークであるRetroChimeraを公開し、オープンソース化した。このフレームワークは2つの補完的なモデルを組み合わせて、高品質な合成経路を提案する。システムは、TransformerベースのデノボモデルであるR-SMILES 2と、グラフニューラルネットワーク(GNN)ベースのモデルであるNeuralLocを、学習されたアンサンブル戦略を用いて統合し、予測結果をランク付けする。

arxiv arXiv cs.AI · 2日前 · 18 回表示

CodeMidasはソースコードを使用してエージェント型コーディングRL環境をスケーリング

研究者らは、オープンソースのコードベースに実装された機能を用いて、ソースコードを唯一の入力として強化学習環境を構築するエージェントパイプライン「CodeMidas」を紹介した。 本手法は、エージェント計算資源を割り当てて機能を探索し、実行に根ざしたテストを構築し、反復ロールアウトを通じてタスクを検証することで、23のプログラミング言語にわたる5,545件のトレーニングデータセットを生成する。 これらのタスクでGRPOを用いてMiMo-V2.5を訓練すると、DeepSWE (+11.7%)、ProgramBench (+17%)、Terminal-Bench v2.1 (+8.5%) など5つの多様なベンチマークでパフォーマンスが向上した。 軌跡分析により、RLで訓練されたエージェントは、コードベースの探索増加やより多様な自己検証など、より優れた行動を示すことが示唆された。 これらの結果は、多様なソフトウェアタスクにおけるコーディングエージェントを改善するRL環境を構築するためのスケーラブルな基盤として、ソースコードを確立するものである。

media Hugging Face Forums · 3日前 · 16 回表示

研究者、LLMの合意不確実性を解消するため独立した1名の注釈担当者を募集

ある研究者は、タスクの解釈的性質に起因するのか、あるいは注釈定義が未確定であることに起因するのかを判断するために、100のトルコ語物語シーンをラベル付けする単一の独立した人間注釈担当者の依頼を行っている。本研究では、4つのLLMとルールベースの検出器が互いに、かつ人間の参照データとほぼ偶然レベルで合意しており、Cohen’s κスコアは0.000から0.185の範囲であった。

media Hugging Face Forums · 3日前 · 17 回表示

GlucoEdge: INT8量子化によるオンデバイス血糖値トレンド予測

独立研究者のMohamed Menasyは、連続血糖モニターデータから5クラス15分先の血糖値トレンドを予測するためのエンドツーエンドのオンデバイス機械学習パイプラインを詳述したエンジニアリング研究「GlucoEdge」を公開しました。本作業では、わずか2,909パラメータからなるコンパクトな1D CNNを導入し、PyTorchからLiteRTへの変換に至る完全なワークフローをカバーしています。

arxiv arXiv cs.LG · 7日前 · 20 回表示

OpenAI、完全に監査可能なトレーニング実行でOpen-1Bをリリース

OpenAIは、トレーニング中のすべての操作が異種のコモディティハードウェア上でビット単位の確実性をもって独立して再現可能である体制下で訓練された言語モデル「Open-1B」をリリースしました。このアプローチは、GPUカーネルの縮約やデータバッチの順序付けなどの非決定性の原因に対して明確な順序を課すことで、オープンソースモデルに内在する再現性の問題を解決します。

arxiv arXiv cs.AI · 8日前 · 24 回表示

Atria Dawn プレビュー: 科学的研究のための基盤エージェント型言語モデル

Atria Dawn Preview は、科学的研究およびエンジニアリングワークフローのために設計された基盤エージェント型言語モデルであり、ツールを介した相互作用を実行可能環境に接続する検証可能な経験パイプラインを通じてトレーニングされています。現実の研究、エンジニアリング、デジタル作業にわたる16のベンチマークにおいて、このモデルは最先端のエージェントと競争力があり、そのうち5つで最高の報告スコアを達成しています。