AI agents
media TLDR AI · 2時間前 · 10 回表示

AnthropicがClaude Projects v2をリリース、Googleが家族エージェントを導入

AnthropicはClaude Projects v2をリリースし、フォルダベースの構造から会話駆動型インターフェースへ機能 redesign し、タスク委譲と並列スレッドを通じてビルドを管理します。同時に、Googleは最大6人の家族メンバーの活動を調整するために専用クラウドコンピュータ上で動作する家族エージェントをテストしています。

media TLDR AI · 2時間前 AIME 2024 · 50.0% · 9 回表示

MetaがMuseコネクタを公開、SAM 3.1をリリース、Geminiがシステムをハッキング

今回のアップデートでは、AIの動向として、Metaが自社のMuseプラットフォームをサードパーティ開発者に開放したこと、セグメンテーションモデルの新バージョンをリリースしたこと、GoogleのGeminiに関連するセキュリティインシデントなどが取り上げられています。

media TLDR AI · 2時間前 · 10 回表示

XiaomiがMiMo-V2.6 ProおよびFlashモデルをオープンソース化

Xiaomiは、インタラクティブな3Dシーンの構築と視覚的テストのためにエージェントを調整するために設計されたオムニモーダルモデルのMiMo-V2.6 ProおよびFlashをオープンソース化しました。これらのモデルはBlenderアセットを生成し、カメラフィードからロボットアームを制御し、フロントエンドやプレゼンテーションを作成し、ビデオを組み立て、スコアとMIDIとして音楽を作曲できます。

arxiv arXiv cs.AI · 2時間前 · 9 回表示

AIDE^2がAI研究エージェントの再帰的自己改善を可能にする

研究者らは、AIDE^2を発表した。これは、自身のコードを最適化することで、AI研究エージェントに対する再帰的自己改善のループを実装するシステムである。このシステムは内部ロジックへの変更を提案し、AI R&Dタスクで修正されたバージョンをベンチマークし、隠れた評価で最高のパフォーマンスを発揮したものだけを保持する。

arxiv arXiv cs.AI · 3時間前 WebArena · 45.3% · 13 回表示

Growing Harnessは失敗誘導型学習により、反復的なエージェント制御を再利用可能なコードに変換する

著者らはGrowing Harnessを紹介する。これは標準的な文脈依存のハッスルに頼るのではなく、タスクフィードバックからエージェントの制御構造を学習するトレーニングパラダイムである。反復的な制御判断を実行可能なコードに変換し、意味的推論のためにLLM呼び出しを予約することで、再利用可能な専門エージェントの作成を目指す。

arxiv arXiv cs.AI · 4時間前 · 9 回表示

CliffCompactionはパフォーマンスを維持しながらコーディングエージェントのコストを50%削減

研究者らは、有界コンテキスト下で長期のコーディングエージェントのコストを最大50%削減するために設計された自動圧縮手法であるCliffCompactionを発表した。この手法は、再表現ではなく切り捨てを通じて圧縮された情報の忠実性を保つことで、Terminal-Benchでのパフォーマンスを維持または向上させ、KernelBenchで最先端の結果を達成している。

arxiv arXiv cs.LG · 4時間前 · 11 回表示

AIDE^2がAI研究エージェントの再帰的自己改善を可能にする

研究者らは、AIDE^2を発表した。これは、フロントティアAI研究エージェントの再帰的自己改善のループを実装するシステムであり、自身のコードを最適化することで実現される。このシステムは内部ロジックへの変更を提案し、変更されたバージョンをAI R&Dタスクでベンチマークし、隠れた評価で最高のパフォーマンスを示す更新のみを保持する。

arxiv arXiv cs.CL · 7時間前 · 11 回表示

Qwenが100万トークンコンテキストを備えたネイティブ多モーダルエージェントモデル「Qwen3.8-Omni-Flash」をリリース

Alibaba Cloudは、実世界の生産性タスク向けに設計されたネイティブな多モーダルエージェントモデルであるQwen3.8-Omni-Flashを発表しました。このモデルは、以前のオムニモデルと比較して、多モーダルな理解と推論を大幅に改善します。

lab xAI News · 10時間前 · 15 回表示

SpaceXAIはGrok Botを活用し、採用増なしでチケット数175%の急増に対応

SpaceXAIはCursor買収後、統合されたカスタマーサポート業務にGrok Bot AIエージェントを組み込み、スタッフ数を増やさずにサポートチケットが175%増加しても対応可能とした。同社は約200人の追加採用を回避し、Grok Botの従量制課金モデルを活用することで、チケットあたりの解決コストを0.20ドルから0.30ドルに削減した。

lab OpenAI News · 11時間前 · 16 回表示

GPT-6 Astra で研究時間とコストを半減

Parallel は OpenAI の GPT-6 Astra を AI エージェントインフラストラクチャに統合し、以前のモデルと比較して研究時間とコードコストの両方を 50% 削減することに成功しました。同社は、新モデルによりエージェントが複雑な知識作業を大幅に高速化しながら、高品質な出力を維持できると報告しています。

lab OpenAI News · 13時間前 · 22 回表示

OpenAI、GPT-6のプロンプトキャッシングをより高いヒット率と診断機能で改善

OpenAIは、デフォルトでより高いキャッシュヒット率を提供し、キャッシュされた入力トークンに対して最大90%の割引を提供するGPT-6ファミリー向けの改善されたプロンプトキャッシングシステムをリリースしました。このアップデートにより、開発者がパフォーマンスを監視し、ミス(未ヒット)を診断し、統合を最適化するための新しいツールが導入されました。

lab Claude Code Releases · 16時間前 · 14 回表示

Claude Code v2.1.280がClaude Opus 5.5を追加し、多数のバグを修正

Claude Codeバージョン2.1.280は、新しいデフォルトのOpusモデルとしてClaude Opus 5.5を導入し、1Mのコンテキストウィンドウと更新された価格体系を特徴としています。このアップデートでは、フルスクリーンモードでリストをスクロールするためのマウスホイールサポートが追加され、MCPツール説明の長さ制限の設定が可能になりました。

arxiv arXiv cs.AI · 22時間前 · 11 回表示

ワールドステートジェネレーターは合成世界と計画を整合させ、エージェントの成功率を向上させる

ワールドステートジェネレーター(WSG)は、失敗後に状態を書き換えることで、言語エージェントの計画を実行環境のルールに合わせ続けるモデルです。プログラムがルールを強制し目標到達可能性を検証する7つの合成ドメインから抽出された226Kの軌道で訓練されています。

media Hugging Face Forums · 1日前 · 10 回表示

マルチエージェントAIにおける分散制約は集合的アイデンティティを持たないエージェントを支配する

新しい分析は、個別に管理されるエージェント間で生成された関係がグループ全体に支配的な力を獲得するマルチエージェントシステムでの現象を浮き彫りにしています。これは、エージェントが持続的なメッセージやアーティファクトを残し、互いの軌道を制約することで、個々のタスクで指定されていない効果的な分散的指向性を作り出す場合に発生します。

media Hugging Face Forums · 1日前 · 10 回表示

jbsalles、LLM用の選択的メモリシステム SelMem を実験

著者は、大規模言語モデル向けの不完美で経路依存型のメモリを実験するために、SelMem という名前の Rust プロジェクトを開発しました。このアプローチは、対話の完全なコピーを保存するのではなく、エージェントが時間をかけて記憶を圧縮し、忘却し、再構築することを可能にすることで人間の記憶を模倣します。

arxiv arXiv cs.AI · 1日前 · 9 回表示

AgentRouterはステップレベルのモデルルーティングにより、エージェントワークフローのコストを72%削減

研究者らは、エージェントRouterを提案した。これは軽量な分類器であり、すべてのタスクに最先端モデルを使用するのではなく、個々の軌跡のステップを適切なモデルティアにルーティングすることで、マルチステップのエージェントワークフローを最適化する。