Faraday 27B が論文再現タスクで Claude Opus 4.8 および GPT-5.5 を上回る
研究者らは、論文再現のためのスケーラブルなタスク空間である Replica を開発し、人間の評価と整合する低ノイズ報酬信号を提供するための自動生成されたルーブリックベースのジャッジを導入しました。
研究者らは、論文再現のためのスケーラブルなタスク空間である Replica を開発し、人間の評価と整合する低ノイズ報酬信号を提供するための自動生成されたルーブリックベースのジャッジを導入しました。
論文では、AutoDesignというフレームワークを紹介しています。これは、ロールアウトフィードバックに基づいてコードエージェントのハーネスを再帰的に改善するよう誘導するためにメタハーネスオプティマイザを採用しています。このアプローチは、人間の設計事前知識と整合させ、再帰的自己改善のために再利用可能な経験を蓄積することを目指しています。
研究者らは、構造化Chain-of-Thoughtと多目的プロセス報酬強化学習を組み合わせることで、Vision-Language Modelsの空間推論を強化するフレームワークであるSCOUTを提案した。このアプローチは、既存のRL手法における信用帰属の問題に対処し、包括的な3D理解のために深度知覚を統合する。
低所得・中所得環境向けに設計された、VITAという目的特化型の検索拡張生成システムが、HealthBenchベンチマークを用いて汎用大規模言語モデルと比較評価された。本研究は、コーパス固有の設計により、新しい最先端モデルがリリースされても競争力のある性能を維持できることを示している。
研究者らは、オープンな大規模言語モデルに対して参照なし後訓練を適用する多言語機械翻訳モデルであるMiLMMT-46-v1.0を開発した。チームは、言語識別によってゲート制御される2つの参照なし品質推定モデルに基づく報酬を用いたグループ相対的政策最適化(GRPO)を採用している。
本記事では、Open-Ended Optimization (OEO) というフレームワークを紹介しています。これは、事前定義された最適化パイプラインに依存するのではなく、最先端のモデルオプティマイザーがオンラインで自身の改善プロセスを動的に構築できるようにするものです。著者たちは、8つのベンチマーク・ターゲット・モデルの設定において14回の直接比較を通じて、OEOを2つの段階的アプローチであるSkillOptおよびGEPAと比較しました。
研究者らは、低遅延の対話をリアルタイムのオーディオビジュアル知覚と統合する Gemini ベースのマルチエージェントシステムである AMIE (Video) を使用して、リアルタイムの臨床ビデオ相談のための初のエキスパートレベル AI システムを実証しました。30人のプライマリケア医師と100のシナリオを対象とした無作為化構造化臨床試験(OSCE)研究では、臨床評価者は、病歴聴取、診断、管理、身体観察において、システムを医師と同程度またはそれ以上と評価しました。
研究者らは、主要な大規模言語モデル(LLM)プロバイダーがステップバイステップの推論トレースを処理する方法におけるアーキテクチャ上の脆弱性を特定しました。プロバイダーはこれらのトレースをクライアントに対して暗号化ブロックとして返しますが、本研究では、これらのブロックが同一プロバイダーのエコシステム内において、異なるセッション、ユーザー、モデル間で完全に互換性があり交換可能であることが判明しました。
Ouroborosは、ツール、プロンプト、コア実装がレビューされたコミットを通じて改善され、それらが後続の作業の実行環境となる自己進化型エージェントのハブです。これは、使用中に見つかったバグや非効率性によってトリガーされる、再帰的な自由進化または経験駆動型のコア進化を通じて動作します。
深信服は、本番環境における新たな脅威に対してLLMの安全防御を継続的に適応させるマルチエージェントシステムであるSESG(Self-Evolving Safety Guardrails)を展開した。同システムはライブトラフィックを監視して新規のジェイルブレイクや有害なカテゴリを検出し、その後、手動介入なしでトレーニングデータの自動合成とモデルの更新を行う。
ある研究により、GPT-5およびGPT-5 Nanoが、微生物発がんに関する研究論文のエビデンス抽出および批判的評価において専門家レベルのパフォーマンスを達成することが示された。研究者らは、MMTV-LVおよび乳癌に焦点を当てた24編の論文からなるデータセットを用い、これらのモデルをGemini 2.5 ProおよびGemini 2.5 Flashと共にドメイン専門家と比較ベンチマークした。
研究者らは、安定したユーザー意図と運用目標を分離し、長期推論のために設計された永続的で自己進化型のエージェントランタイムであるArgusを発表した。このシステムは、Manager、Planner、Engineer、Reviewerの役割を活用して、耐久性のあるプロジェクト状態上で制約付きミッションを実行し、オペレーターによるエスカレーションポイント間で自律的な実行を可能にする。
著者らは、SciCodeベンチマークでのスコアの頭打ちが、モデルの能力の限界ではなく評価ツールの重大な欠陥に起因することを特定した。ドメイン専門家の65件のテスト問題に対する監査により263件の欠陥が発見され、そのうち192件は再現不能な正解や過度に厳しい許容範囲などの問題により、正しい解答が誤って却下される原因となっていた。
研究者らは、Video-DeepResearch (Video-DR) を導入した。これは、マルチモーダルエージェントを静止画像から連続動画ストリームへと拡張するフレームワークであり、モダリティバイアスとパラメトリックな知識の漏洩に対処する。
Qwenチームは、モバイル、コンピュータ使用、Web、DeepSearch環境で信頼性の高い操作を実現するために設計された、現実世界中心の基盤GUIエージェントであるQwen-UI-Agentの技術レポートを発表しました。本システムは、多様なサンドボックス環境と大規模な実機モバイルランタイムを組み合わせ、GUI操作とCLI実行を交互に行い、長期のタスクをサポートします。
研究者らは、2Dおよび3Dの医療画像理解を統合することで、臨床現場でのAI導入の課題に対処するために設計されたビジョン中心のマルチモーダル大規模言語モデルであるClinFusionを紹介した。本システムは、Cascade Spatial-Aware Locality Fusion演算子を持つ構成型カスケードビジョンエンコーダを特徴とし、MedIF-Benchおよび領域焦点(ROI)ベースの指標からなる新しい評価フレームワークを含んでいる。
本記事では、フロントティア大規模言語モデルにおける「例外チェーン崩壊(exception chain collapse)」と呼ばれる失敗クラスが文書化されています。これは、モデルがネストされた条件付きルールを誤って評価する現象です。これに対処するため、著者は Aethis Eligibility Module を提案します。これは LLM が作成したルールと SMT ベースのレイヤーを組み合わせた神経記号的アーキテクチャで、決定論的な実行を実現します。
OpenForgeRLは、研究者が標準的な強化学習スタックを使用してハーネスベースのAIエージェントをエンドツーエンドで学習できるようにするオープンソースフレームワークです。これは、モデル呼び出しをデータとして記録する軽量プロキシと、リモートコンテナの展開を管理するKubernetesオーケストレーターを通じて、学習と推論を分離することで実現されます。
研究者たちは、複雑なクエリにおける発見と検証の非対称性に対処するために設計された、再帰的自己改善(RSI)ディープリサーチエージェントのファミリーであるAREXを紹介します。AREXは、証拠を収集して暫定的な回答を構築する内部ループと、制約を監査して対象的な改良をガイドする外部ループを交互に実行します。
SLAIは、Ascend NPU SuperPOD上で兆規模のパラメータを持つMoEモデルのフルパラメータ後処理のためのエンドツーエンド最適化フレームワークであるT-Rexを導入しました。DeepSeek-V4モデルファミリーを対象ワークロードとして使用し、本システムは階層型並列化とカーネル実行の最適化を通じてメモリ圧力と通信オーバーヘッドに対処しています。