AnthropicがClaude Projects v2をリリース、Googleが家族エージェントを導入
AnthropicはClaude Projects v2をリリースし、フォルダベースの構造から会話駆動型インターフェースへ機能 redesign し、タスク委譲と並列スレッドを通じてビルドを管理します。同時に、Googleは最大6人の家族メンバーの活動を調整するために専用クラウドコンピュータ上で動作する家族エージェントをテストしています。
AnthropicはClaude Projects v2をリリースし、フォルダベースの構造から会話駆動型インターフェースへ機能 redesign し、タスク委譲と並列スレッドを通じてビルドを管理します。同時に、Googleは最大6人の家族メンバーの活動を調整するために専用クラウドコンピュータ上で動作する家族エージェントをテストしています。
今回のアップデートでは、AIの動向として、Metaが自社のMuseプラットフォームをサードパーティ開発者に開放したこと、セグメンテーションモデルの新バージョンをリリースしたこと、GoogleのGeminiに関連するセキュリティインシデントなどが取り上げられています。
Xiaomiは、インタラクティブな3Dシーンの構築と視覚的テストのためにエージェントを調整するために設計されたオムニモーダルモデルのMiMo-V2.6 ProおよびFlashをオープンソース化しました。これらのモデルはBlenderアセットを生成し、カメラフィードからロボットアームを制御し、フロントエンドやプレゼンテーションを作成し、ビデオを組み立て、スコアとMIDIとして音楽を作曲できます。
研究者らは、AIDE^2を発表した。これは、自身のコードを最適化することで、AI研究エージェントに対する再帰的自己改善のループを実装するシステムである。このシステムは内部ロジックへの変更を提案し、AI R&Dタスクで修正されたバージョンをベンチマークし、隠れた評価で最高のパフォーマンスを発揮したものだけを保持する。
著者らはGrowing Harnessを紹介する。これは標準的な文脈依存のハッスルに頼るのではなく、タスクフィードバックからエージェントの制御構造を学習するトレーニングパラダイムである。反復的な制御判断を実行可能なコードに変換し、意味的推論のためにLLM呼び出しを予約することで、再利用可能な専門エージェントの作成を目指す。
研究者らは、有界コンテキスト下で長期のコーディングエージェントのコストを最大50%削減するために設計された自動圧縮手法であるCliffCompactionを発表した。この手法は、再表現ではなく切り捨てを通じて圧縮された情報の忠実性を保つことで、Terminal-Benchでのパフォーマンスを維持または向上させ、KernelBenchで最先端の結果を達成している。
研究者らは、AIDE^2を発表した。これは、フロントティアAI研究エージェントの再帰的自己改善のループを実装するシステムであり、自身のコードを最適化することで実現される。このシステムは内部ロジックへの変更を提案し、変更されたバージョンをAI R&Dタスクでベンチマークし、隠れた評価で最高のパフォーマンスを示す更新のみを保持する。
研究者らは、数百万トークンを扱うエージェント向けに設計された自動圧縮手法であるCliffCompactionを発表した。これは有界コンテキスト下でコストを最大50%削減する。
研究者らは、集中オーケストレーターのボトルネックを解消し、並行ワーカーがサブタスクを非同期で引き受けて進捗をマージできるようにする、スケーラブルな自己組織化マルチエージェントハーネスである Agensh を紹介しました。
Alibaba Cloudは、実世界の生産性タスク向けに設計されたネイティブな多モーダルエージェントモデルであるQwen3.8-Omni-Flashを発表しました。このモデルは、以前のオムニモデルと比較して、多モーダルな理解と推論を大幅に改善します。
SpaceXAIはCursor買収後、統合されたカスタマーサポート業務にGrok Bot AIエージェントを組み込み、スタッフ数を増やさずにサポートチケットが175%増加しても対応可能とした。同社は約200人の追加採用を回避し、Grok Botの従量制課金モデルを活用することで、チケットあたりの解決コストを0.20ドルから0.30ドルに削減した。
Parallel は OpenAI の GPT-6 Astra を AI エージェントインフラストラクチャに統合し、以前のモデルと比較して研究時間とコードコストの両方を 50% 削減することに成功しました。同社は、新モデルによりエージェントが複雑な知識作業を大幅に高速化しながら、高品質な出力を維持できると報告しています。
OpenAIは、デフォルトでより高いキャッシュヒット率を提供し、キャッシュされた入力トークンに対して最大90%の割引を提供するGPT-6ファミリー向けの改善されたプロンプトキャッシングシステムをリリースしました。このアップデートにより、開発者がパフォーマンスを監視し、ミス(未ヒット)を診断し、統合を最適化するための新しいツールが導入されました。
AntLingは、2つの6Bパラメータモデル(Ming-Image-0.1-DesignとMing-Image-0.1-Design-Layer)を含むMing-Image-0.1-Designファミリーをリリースしました。
Claude Codeバージョン2.1.280は、新しいデフォルトのOpusモデルとしてClaude Opus 5.5を導入し、1Mのコンテキストウィンドウと更新された価格体系を特徴としています。このアップデートでは、フルスクリーンモードでリストをスクロールするためのマウスホイールサポートが追加され、MCPツール説明の長さ制限の設定が可能になりました。
ワールドステートジェネレーター(WSG)は、失敗後に状態を書き換えることで、言語エージェントの計画を実行環境のルールに合わせ続けるモデルです。プログラムがルールを強制し目標到達可能性を検証する7つの合成ドメインから抽出された226Kの軌道で訓練されています。
XiaomiはMiMo-V2.6シリーズをリリースし、MiMo-V2.6-ProやMiMo-V2.6-Flashなど、ネイティブにオムニモーダルなモデルを導入した。同社はまた、同等の品質で最大20倍の高速出力を実現するMiMo-V2.6-Pro-UltraSpeedも発表した。
新しい分析は、個別に管理されるエージェント間で生成された関係がグループ全体に支配的な力を獲得するマルチエージェントシステムでの現象を浮き彫りにしています。これは、エージェントが持続的なメッセージやアーティファクトを残し、互いの軌道を制約することで、個々のタスクで指定されていない効果的な分散的指向性を作り出す場合に発生します。
著者は、大規模言語モデル向けの不完美で経路依存型のメモリを実験するために、SelMem という名前の Rust プロジェクトを開発しました。このアプローチは、対話の完全なコピーを保存するのではなく、エージェントが時間をかけて記憶を圧縮し、忘却し、再構築することを可能にすることで人間の記憶を模倣します。
研究者らは、エージェントRouterを提案した。これは軽量な分類器であり、すべてのタスクに最先端モデルを使用するのではなく、個々の軌跡のステップを適切なモデルティアにルーティングすることで、マルチステップのエージェントワークフローを最適化する。