トピック · AI agents
lab Google DeepMind Blog · 23時間前 DeepSWE · 77.9% · 7 回表示

Googleが1Mトークン制限のGemini 4 Argon最先端モデルを発表

Googleは、ソフトウェアエンジニアリング、エンタープライズ知識作業、サイバーセキュリティ防御における複雑で長期にわたるワークフローでの深い推論のために設計された新しい最先端モデルであるGemini 4 Argonを発表しました。このモデルは現在、Fairwindプログラムを通じて信頼できるサイバー防衛者に展開されており、Googleは米国政府との自発的なプレリリースプロセスを進めています。

lab OpenAI News · 23日前 · 32 回表示

OpenAIの内部システムがナヴィエ・ストークス方程式の有限時間特異点発生を証明

OpenAIは、内部AIシステムが流体運動のナヴィエ・ストークス方程式の力学が有限時間で特異点を発展させることを示す証明を生み出したと報告しています。この解はGPT-6 Astraよりも大幅に高性能なモデルで駆動されるマルチエージェントシステムによって導出され、ミレニアム懸賞問題の定式化における命題「C」を確立しました。

lab OpenAI News · 23日前 · 54 回表示

OpenAI、GPT-6 Astraの能力、Jalapeñoチップのパフォーマンス、および計算戦略の詳細

OpenAIは、最も知的なモデルとしてGPT-6 Astraを発表し、新しいJalapeño推論チップを含むフルスタックの計算戦略を明らかにした。同社は、InferenceXテストにおいて、カスタムハードウェアが商用システムと比較してワットあたりのピークトークン処理速度で1.5倍から1.9倍高いことを報告している。

lab Google DeepMind Blog · 29日前 Humanity's Last Exam · 54.9% · 54 回表示

Google、Gemini 3.8 Flashおよび3.8 Flash Cyberを発表

GoogleはGemini 3.8をリリースし、一般推論やコーディングタスク向けのGemini 3.8 Flashと、サイバーセキュリティアプリケーションに特化したGemini 3.8 Flash Cyberの2つの新バリエーションを搭載しています。両モデルとも、以前の3.7 Flash世代の高速性と低コストを維持しつつ、大幅なパフォーマンス向上を実現しています。

lab Microsoft Research Blog · 2日前 · 5 回表示

Microsoft Researchがマルチモーダル生物研究のためのAIシステム「Quine」を発表

Microsoft Researchは、生物学のマルチモーダル世界モデルを構築し、モデル、科学ツール、文献、研究者をつなぐインタラクティブなハーンチを提供する新しい研究取り組み「Quine」を発表した。このシステムは、科学者が提案を生成し、それをウェットラボ環境でテストできるようにすることで、計算モデリングと実際の実験の間のギャップを埋めることを目的としている。その結果は将来の質問を精緻化するためにフィードバックされる。

lab OpenAI News · 2日前 · 9 回表示

OpenAI、GPT-6 Astraを搭載した常時稼働型AIエージェント「Dots」を発表

OpenAIは、クラウドコンピューティングインフラを活用して自律的にタスクを処理する新種の常時稼働型AIエージェント「Dots」をリリースしました。GPT-6 Astraモデルを搭載し、これらのエージェントはプラグインを通じて4,000以上のアプリに接続し、ユーザーからのフィードバックを学習しながら24時間365日特定の目標に向かって動作します。

lab OpenAI News · 8日前 · 20 回表示

Airbnb、OpenAI GPT-6 Astraおよびその他のフロンティアモデルへのアクセスを拡大

Airbnbは、エンジニアリングおよび製品開発チームに対して、GPT-6 Astraを含むOpenAIのフロンティアモデルへのより広範なアクセスを提供する新たな契約を結びました。この拡大は、既存のCodexの利用とOpenAIとの協力に基づき、OpenAI APIおよびAmazon Bedrockを通じてアクセスを拡張します。

lab Anthropic News · 8日前 · 41 回表示

AnthropicのClaudeがファージ中で新たなART酵素系を発見

Anthropicは、Claudeを用いて未特徴のタンパク質ファミリーを同定し、実験室での実験を通じて仮説を検証することを目的とした新しいライフサイエンス研究グループを設置したと発表した。初期結果として、AIはファージ中に存在する配列関連逆転写酵素(ART)と呼ばれる新たな酵素系を自律的に発見した。

lab OpenAI News · 14日前 GAIA · 54.0% · 26 回表示

OpenAI、GPT-6 Astraと法廷検索インデックスを用いた「Astra for Law」を発表

OpenAIは、GPT-6 Astraモデルに専門的な設定、ツール、文脈を組み合わせた、プロの法律業務向けに特別に調整された新しい基盤である「Astra for Law」をリリースした。この構成には、関連する権威ある資料を見つけるのを支援するために、2億3,000万超のURLと米国における先例のある判例法の99.9%をカバーする強力な法的検索インデックスが含まれている。

lab OpenAI News · 21日前 · 52 回表示

OpenAIがAgents APIをパブリックベータで提供開始

OpenAIは、長期実行かつ本番環境対応のエージェント構築用に設計された管理されたハネスとインフラストラクチャを提供するAgents APIのパブリックベータ版をリリースしました。このリリースにより、Codexを支える基盤技術が外部開発者に提供され、タスク、モデル、ツール、環境を指定するだけで1回のAPI呼び出しでエージェントを作成できるようになります。

lab OpenAI News · 25日前 · 51 回表示

OpenAI、自動化された研究インターンとコーディングエージェントがRSIへの進展を加速していると報告

OpenAIは、自動化されたAI研究者やコーディングエージェントが同社の研究ペースを大幅に加速させており、組織が9月までに自動化された「研究インターン」の目標を達成したことを示す内部指標を公開した。同社は、人間の監督を維持しつつ、ディープラーニングとアライメントにおけるさらなる進展を図るため、2028年3月までに完全に自動化されたAI研究者を構築する目的を持っている。

lab OpenAI News · 28日前 · 44 回表示

OpenAI、最前線の防衛者を支援するDaybreak AIに10億ドルの補助金をコミット

OpenAIは、「Frontline DefendersのためのDaybreak」を立ち上げ、サイバー防衛者が重要インフラを保護できるよう、補助付きアクセス、トレーニング、技術サポートとして10億ドルをコミットする世界的なイニシアチブを開始します。このプログラムは、水道事業者、電力グリッド運用者、地方自治体など、リソースが限られた組織を対象としており、大企業を超えて最先端のAIサイバーセキュリティ能力を普及させることを目的としています。

lab Google — The Keyword (AI) · 29日前 · 59 回表示

Google、Gemini 3.8 Flash Cyberを用いたFairwindプログラムを立ち上げ、積極的な防御を実現

Googleは、信頼できる政府機関、企業パートナー、サイバーセキュリティ組織に対し、先進的なAI機能への早期アクセスを提供し、積極的なサイバー防御を支援するFairwindプログラムを開始した。この取り組みでは、Gemini 3.8 Flash CyberモデルとCodeMenderハーンチを組み合わせて、防御者が大規模な脆弱性の自主的な発見、検証、修正を可能にする。

lab Google DeepMind Blog · 29日前 · 54 回表示

Google、Gemini 3.8 Flash Cyberを用いたFairwindプログラムを立ち上げ、積極的な防御を実現

Googleは、政府機関、企業顧客、サイバーセキュリティパートナーに対し、先進的なAI機能へのアクセスを提供するFairwindプログラムを開始した。この取り組みは、Gemini 3.8 Flash Cyberの専門的な推論能力とCodeMenderハッチを組み合わせることで、防御者が大規模な脆弱性の自主的な発見と修正を支援することを目指している。

lab NVIDIA Research · 4時間前 Terminal-Bench · 68.03% · 7 回表示

Mid-Harnessはテスト時の計算量スケーリングによりターミナルエージェントのアクション信頼性を向上させる

研究者らは、モデルとハーネスの境界で候補アクションをサンプリングして検証し、ターミナルエージェントの実行信頼性を向上させる手法であるMid-Harnessを発表した。このアプローチは、実行のために1つのアクションを送信する前に複数のオプションを検証することでテスト時の計算量を割り当て、ジェネレーターとハーネスの変更は行わない。

lab Anthropic News · 12時間前 · 4 回表示

バークレイズがClaudeを活用して業務を強化し、顧客体験を向上

バークレイズはAnthropicとの戦略的協力を拡大し、グローバルな業務全体に安全でエンタープライズグレードのAIシステムを導入する。同銀行は2026年末までにClaude Codeを開発者の50%に展開することで、ソフトウェア開発の加速、レガシーシステムの近代化、運用効率の向上を目指している。