AIDE^2がAI研究エージェントの再帰的自己改善を可能にする
研究者らは、AIDE^2を発表した。これは、自身のコードを最適化することで、AI研究エージェントに対する再帰的自己改善のループを実装するシステムである。このシステムは内部ロジックへの変更を提案し、AI R&Dタスクで修正されたバージョンをベンチマークし、隠れた評価で最高のパフォーマンスを発揮したものだけを保持する。
研究者らは、AIDE^2を発表した。これは、自身のコードを最適化することで、AI研究エージェントに対する再帰的自己改善のループを実装するシステムである。このシステムは内部ロジックへの変更を提案し、AI R&Dタスクで修正されたバージョンをベンチマークし、隠れた評価で最高のパフォーマンスを発揮したものだけを保持する。
著者らはGrowing Harnessを紹介する。これは標準的な文脈依存のハッスルに頼るのではなく、タスクフィードバックからエージェントの制御構造を学習するトレーニングパラダイムである。反復的な制御判断を実行可能なコードに変換し、意味的推論のためにLLM呼び出しを予約することで、再利用可能な専門エージェントの作成を目指す。
研究者らは、AIDE^2を発表した。これは、フロントティアAI研究エージェントの再帰的自己改善のループを実装するシステムであり、自身のコードを最適化することで実現される。このシステムは内部ロジックへの変更を提案し、変更されたバージョンをAI R&Dタスクでベンチマークし、隠れた評価で最高のパフォーマンスを示す更新のみを保持する。
研究者らは、集中オーケストレーターのボトルネックを解消し、並行ワーカーがサブタスクを非同期で引き受けて進捗をマージできるようにする、スケーラブルな自己組織化マルチエージェントハーネスである Agensh を紹介しました。
研究者らは、TelecomGPT-R1を発表した。これは、規格、構成、ログに対する推論を通じてエンジニアリングタスクを自動化するために設計された、オープンソースの統一型テレコム推論モデルファミリーである。このモデルは、プロトコル、知識、モデリング、障害の各軸をカバーする構造化アプローチを通じて、既存の汎用および専門的なLLMの制限に対処する。
著者は、診断および臨床ヘルスケアの推論を強化するために合成データとルーブリックベースの強化学習を使用する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまず、診断のためにMedBullets由来の質問にルール誘導型RLを適用し、その後、対話型臨床タスクのために多次元ルーブリックを持つ5.3kの合成マルチターンシナリオを利用します。
著者は、合成データとルーブリックベースの強化学習を使用して、診断および臨床医療の推論の両方を強化する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまずMedBullets由来の質問を使用して診断精度を対象とし、その後多次元ルーブリックを持つ5.3kの生成シナリオを通じてマルチターン臨床対話を扱います。
著者らは、合成データとルーブリックベースの強化学習を用いて、診断および臨床医療の推論の両方を強化する 30B パラメータのモデル Fathom-Vaidya を紹介しています。
Microsoft Researchは、逆合成予測のための新しいフレームワークであるRetroChimeraを公開し、オープンソース化した。このフレームワークは2つの補完的なモデルを組み合わせて、高品質な合成経路を提案する。システムは、TransformerベースのデノボモデルであるR-SMILES 2と、グラフニューラルネットワーク(GNN)ベースのモデルであるNeuralLocを、学習されたアンサンブル戦略を用いて統合し、予測結果をランク付けする。
著者は、2つの命題間の矛盾を検出するための推論システムの研究設計を提案しています。これは、直接のLLM判断に依存するのではなく、それらをより小さなコンポーネントに分解し、論理的な衝突を検索することによって行われます。
研究者らは、オープンソースのコードベースに実装された機能を用いて、ソースコードを唯一の入力として強化学習環境を構築するエージェントパイプライン「CodeMidas」を紹介した。 本手法は、エージェント計算資源を割り当てて機能を探索し、実行に根ざしたテストを構築し、反復ロールアウトを通じてタスクを検証することで、23のプログラミング言語にわたる5,545件のトレーニングデータセットを生成する。 これらのタスクでGRPOを用いてMiMo-V2.5を訓練すると、DeepSWE (+11.7%)、ProgramBench (+17%)、Terminal-Bench v2.1 (+8.5%) など5つの多様なベンチマークでパフォーマンスが向上した。 軌跡分析により、RLで訓練されたエージェントは、コードベースの探索増加やより多様な自己検証など、より優れた行動を示すことが示唆された。 これらの結果は、多様なソフトウェアタスクにおけるコーディングエージェントを改善するRL環境を構築するためのスケーラブルな基盤として、ソースコードを確立するものである。
研究者らは、臨床開発計画(CDP)を支援するために設計されたメモリ拡張型マルチエージェント研究組織であるTrialAtlasを導入した。このシステムは、文献合成、競合インテリジェンス、規制分析のための専門エージェントを調整し、開発リスクを予測する。
MB-Bidramは、推論能力と知識の記憶を分離するように設計されたWideNDepth(WND)という実験的なニューラルアーキテクチャをリリースしました。モデルはメモリとして機能する「Wide部分」と推論者として機能する「Depth部分」で構成されています。
ある研究者は、タスクの解釈的性質に起因するのか、あるいは注釈定義が未確定であることに起因するのかを判断するために、100のトルコ語物語シーンをラベル付けする単一の独立した人間注釈担当者の依頼を行っている。本研究では、4つのLLMとルールベースの検出器が互いに、かつ人間の参照データとほぼ偶然レベルで合意しており、Cohen’s κスコアは0.000から0.185の範囲であった。
独立研究者のMohamed Menasyは、連続血糖モニターデータから5クラス15分先の血糖値トレンドを予測するためのエンドツーエンドのオンデバイス機械学習パイプラインを詳述したエンジニアリング研究「GlucoEdge」を公開しました。本作業では、わずか2,909パラメータからなるコンパクトな1D CNNを導入し、PyTorchからLiteRTへの変換に至る完全なワークフローをカバーしています。
Hugging Faceフォーラムのユーザーが、段階的知識転送の実験を提案しています。この手法では、固定サイズの生徒モデル(Qwen 4B)が、最大の利用可能なモデルから直接学ぶのではなく、より大きな教師モデルから順次学習します。
独立した研究者が、量子化、プルーニング、蒸留などのモデル圧縮技術が実際に測定されたエネルギー消費を削減するのか、それとも単に FLOPs を低減させるだけなのかを分析する文献レビューを発表しました。
本記事では、制約 aware な構成計画を活用したヒューマンからロボットへの転移手法である Human2Any を紹介する。ソースにはそれ以上の詳細や本文は記載されていない。
OpenAIは、トレーニング中のすべての操作が異種のコモディティハードウェア上でビット単位の確実性をもって独立して再現可能である体制下で訓練された言語モデル「Open-1B」をリリースしました。このアプローチは、GPUカーネルの縮約やデータバッチの順序付けなどの非決定性の原因に対して明確な順序を課すことで、オープンソースモデルに内在する再現性の問題を解決します。
Atria Dawn Preview は、科学的研究およびエンジニアリングワークフローのために設計された基盤エージェント型言語モデルであり、ツールを介した相互作用を実行可能環境に接続する検証可能な経験パイプラインを通じてトレーニングされています。現実の研究、エンジニアリング、デジタル作業にわたる16のベンチマークにおいて、このモデルは最先端のエージェントと競争力があり、そのうち5つで最高の報告スコアを達成しています。