ソース · arXiv cs.AI
arxiv arXiv cs.AI · 17時間前

AutoDesignはメタハーネス最適化を使用して長期エージェント設計を改善

論文では、AutoDesignというフレームワークを紹介しています。これは、ロールアウトフィードバックに基づいてコードエージェントのハーネスを再帰的に改善するよう誘導するためにメタハーネスオプティマイザを採用しています。このアプローチは、人間の設計事前知識と整合させ、再帰的自己改善のために再利用可能な経験を蓄積することを目指しています。

arxiv arXiv cs.AI · 2日前 · 3 回表示

SCOUTは構造化CoTとプロセス監督型RLによりVLMの空間推論を向上させる

研究者らは、構造化Chain-of-Thoughtと多目的プロセス報酬強化学習を組み合わせることで、Vision-Language Modelsの空間推論を強化するフレームワークであるSCOUTを提案した。このアプローチは、既存のRL手法における信用帰属の問題に対処し、包括的な3D理解のために深度知覚を統合する。

arxiv arXiv cs.AI · 2日前 HealthBench · 51.9% · 4 回表示

VITAの臨床用RAGはHealthBenchにおいて最先端LLMと同等かそれ以上の性能を示す

低所得・中所得環境向けに設計された、VITAという目的特化型の検索拡張生成システムが、HealthBenchベンチマークを用いて汎用大規模言語モデルと比較評価された。本研究は、コーパス固有の設計により、新しい最先端モデルがリリースされても競争力のある性能を維持できることを示している。

arxiv arXiv cs.AI · 4日前

オープンエンド最適化によりGPT-5.5が自身の改善プロセスを構築

本記事では、Open-Ended Optimization (OEO) というフレームワークを紹介しています。これは、事前定義された最適化パイプラインに依存するのではなく、最先端のモデルオプティマイザーがオンラインで自身の改善プロセスを動的に構築できるようにするものです。著者たちは、8つのベンチマーク・ターゲット・モデルの設定において14回の直接比較を通じて、OEOを2つの段階的アプローチであるSkillOptおよびGEPAと比較しました。

arxiv arXiv cs.AI · 4日前

AMIE (Video) がリアルタイムの医療相談でエキスパートレベルのパフォーマンスを達成

研究者らは、低遅延の対話をリアルタイムのオーディオビジュアル知覚と統合する Gemini ベースのマルチエージェントシステムである AMIE (Video) を使用して、リアルタイムの臨床ビデオ相談のための初のエキスパートレベル AI システムを実証しました。30人のプライマリケア医師と100のシナリオを対象とした無作為化構造化臨床試験(OSCE)研究では、臨床評価者は、病歴聴取、診断、管理、身体観察において、システムを医師と同程度またはそれ以上と評価しました。

arxiv arXiv cs.AI · 4日前 · 16 回表示

攻撃者が暗号化ブロックの脆弱性を通じてプロプライエタリなLLM APIから推論トレースを窃取

研究者らは、主要な大規模言語モデル(LLM)プロバイダーがステップバイステップの推論トレースを処理する方法におけるアーキテクチャ上の脆弱性を特定しました。プロバイダーはこれらのトレースをクライアントに対して暗号化ブロックとして返しますが、本研究では、これらのブロックが同一プロバイダーのエコシステム内において、異なるセッション、ユーザー、モデル間で完全に互換性があり交換可能であることが判明しました。

arxiv arXiv cs.AI · 4日前 OSWorld · 90.69% · 6 回表示

自己進化型エージェントOuroborosがOpus 5で新ベンチマークを樹立

Ouroborosは、ツール、プロンプト、コア実装がレビューされたコミットを通じて改善され、それらが後続の作業の実行環境となる自己進化型エージェントのハブです。これは、使用中に見つかったバグや非効率性によってトリガーされる、再帰的な自由進化または経験駆動型のコア進化を通じて動作します。

arxiv arXiv cs.AI · 4日前

深信服が自己進化型安全ガードレールシステムSESGを展開

深信服は、本番環境における新たな脅威に対してLLMの安全防御を継続的に適応させるマルチエージェントシステムであるSESG(Self-Evolving Safety Guardrails)を展開した。同システムはライブトラフィックを監視して新規のジェイルブレイクや有害なカテゴリを検出し、その後、手動介入なしでトレーニングデータの自動合成とモデルの更新を行う。

arxiv arXiv cs.AI · 5日前 · 12 回表示

GPT-5とGPT-5 Nanoが微生物発がん研究の評価において専門家と同等の性能を示す

ある研究により、GPT-5およびGPT-5 Nanoが、微生物発がんに関する研究論文のエビデンス抽出および批判的評価において専門家レベルのパフォーマンスを達成することが示された。研究者らは、MMTV-LVおよび乳癌に焦点を当てた24編の論文からなるデータセットを用い、これらのモデルをGemini 2.5 ProおよびGemini 2.5 Flashと共にドメイン専門家と比較ベンチマークした。

arxiv arXiv cs.AI · 9日前 SWE-bench Pro · 78.0% · 1 回表示

Argus: 長期推論のための汎用エージェントランタイム

研究者らは、安定したユーザー意図と運用目標を分離し、長期推論のために設計された永続的で自己進化型のエージェントランタイムであるArgusを発表した。このシステムは、Manager、Planner、Engineer、Reviewerの役割を活用して、耐久性のあるプロジェクト状態上で制約付きミッションを実行し、オペレーターによるエスカレーションポイント間で自律的な実行を可能にする。

arxiv arXiv cs.AI · 9日前

SciCode-Verifiedがベンチマークの欠陥を修正し、モデルの本格的な科学コーディング能力を明らかにする

著者らは、SciCodeベンチマークでのスコアの頭打ちが、モデルの能力の限界ではなく評価ツールの重大な欠陥に起因することを特定した。ドメイン専門家の65件のテスト問題に対する監査により263件の欠陥が発見され、そのうち192件は再現不能な正解や過度に厳しい許容範囲などの問題により、正しい解答が誤って却下される原因となっていた。

arxiv arXiv cs.AI · 15日前 WebArena · 73.6% · 4 回表示

Qwen-UI-Agentがモバイルユースベンチマークで最良の成果を達成

Qwenチームは、モバイル、コンピュータ使用、Web、DeepSearch環境で信頼性の高い操作を実現するために設計された、現実世界中心の基盤GUIエージェントであるQwen-UI-Agentの技術レポートを発表しました。本システムは、多様なサンドボックス環境と大規模な実機モバイルランタイムを組み合わせ、GUI操作とCLI実行を交互に行い、長期のタスクをサポートします。

arxiv arXiv cs.AI · 18日前 · 1 回表示

ClinFusionが包括的な医療理解のためのビジョン中心のMLLMを導入

研究者らは、2Dおよび3Dの医療画像理解を統合することで、臨床現場でのAI導入の課題に対処するために設計されたビジョン中心のマルチモーダル大規模言語モデルであるClinFusionを紹介した。本システムは、Cascade Spatial-Aware Locality Fusion演算子を持つ構成型カスケードビジョンエンコーダを特徴とし、MedIF-Benchおよび領域焦点(ROI)ベースの指標からなる新しい評価フレームワークを含んでいる。

arxiv arXiv cs.AI · 18日前

Aethis Eligibility Module は神経記号的アーキテクチャを使用して LLM のルール評価エラーを修正

本記事では、フロントティア大規模言語モデルにおける「例外チェーン崩壊(exception chain collapse)」と呼ばれる失敗クラスが文書化されています。これは、モデルがネストされた条件付きルールを誤って評価する現象です。これに対処するため、著者は Aethis Eligibility Module を提案します。これは LLM が作成したルールと SMT ベースのレイヤーを組み合わせた神経記号的アーキテクチャで、決定論的な実行を実現します。

arxiv arXiv cs.AI · 22日前 OSWorld · 37.7% · 5 回表示

OpenForgeRLは、あらゆる環境でハーネスベースのエージェントのエンドツーエンド学習を可能にする

OpenForgeRLは、研究者が標準的な強化学習スタックを使用してハーネスベースのAIエージェントをエンドツーエンドで学習できるようにするオープンソースフレームワークです。これは、モデル呼び出しをデータとして記録する軽量プロキシと、リモートコンテナの展開を管理するKubernetesオーケストレーターを通じて、学習と推論を分離することで実現されます。

arxiv arXiv cs.AI · 22日前 · 4 回表示

AREX、再帰的に自己改善するディープリサーチエージェントを導入

研究者たちは、複雑なクエリにおける発見と検証の非対称性に対処するために設計された、再帰的自己改善(RSI)ディープリサーチエージェントのファミリーであるAREXを紹介します。AREXは、証拠を収集して暫定的な回答を構築する内部ループと、制約を監査して対象的な改良をガイドする外部ループを交互に実行します。

arxiv arXiv cs.AI · 23日前 · 4 回表示

SLAIのT-RexがAscend SuperPOD上でDeepSeek-V4のフルパラメータ後処理を可能にする

SLAIは、Ascend NPU SuperPOD上で兆規模のパラメータを持つMoEモデルのフルパラメータ後処理のためのエンドツーエンド最適化フレームワークであるT-Rexを導入しました。DeepSeek-V4モデルファミリーを対象ワークロードとして使用し、本システムは階層型並列化とカーネル実行の最適化を通じてメモリ圧力と通信オーバーヘッドに対処しています。