ソース · MarkTechPost
media MarkTechPost · 1日前 OSWorld 2.0 · 72.6% · 2 回表示

OpenAIが「dots」を発売:専用クラウドコンピューターを搭載した永続型GPT-6 Astraエージェント

OpenAIは、GPT-6 Astraモデルによって駆動される永続型AIエージェントを特徴とする新しいマネージド製品「dots」を発表した。各dotは専用のクラウドコンピューターとブラウザ上で動作し、ChatGPTプラグインを通じて4,000以上のアプリケーション間で作業し、ユーザーがログオフしてもタスクを継続できる。

media MarkTechPost · 8日前 GDPval-AA (Elo) · 1695.0Elo · 23 回表示

SpaceXAIがGrok 4.7をリリース、より大規模なベースモデルと改善されたベンチマーク

SpaceXAIは、Grok 4.6と比較してより大規模なベースモデルと拡張された強化学習ランを用い、コーディング、エージェントタスク、ナレッジワーク向けの新しいフラッグシップモデルであるGrok 4.7をリリースした。このモデルは、前任者と同じ価格構造を維持しつつ、自己検証、長文脈処理、安全性の面で強化された機能を提供する。

media MarkTechPost · 12日前 · 35 回表示

アリババのQwenが1Mコンテキストを持つエージェント型オムニモーダルモデル「Qwen3.8-Omni-Flash」をリリース

アリババのQwenチームは、音声・映像の理解とツール利用のためのエージェント機能を中核に設計された初のオムニモーダルモデルであるQwen3.8-Omni-Flashをリリースしました。このモデルはテキスト、画像、音声、動画の入力を受け取り、テキスト出力を返すもので、1Mトークンのコンテキストウィンドウとネイティブな関数呼び出し機能を備えています。

media MarkTechPost · 17日前 · 40 回表示

Anthropicが埋め込み評価者を組み込んだ「フロンティアをペースする」計画を提案

2026年9月12日、AnthropicのCEOであるダリオ・アモダイは「私たちはフロンティアをペースしなければならない」と題したエッセイを発表し、AI能力の向上にブレーキをかけるよう呼びかけた。この提案には、トレーニングパイプラインへの従業員レベルのアクセス権を持つ第三者の「埋め込み評価者」の設置、フロンティアラボ間での安全基準の調整、およびAI制限に関する国際合意の追求という3つのステップが含まれる。

media MarkTechPost · 20日前 · 55 回表示

DeepSeekが1MコンテキストとFP4 KVキャッシュを搭載したDeepSeek-V4.1-Flashをリリース

DeepSeek AIは、100万トークンのコンテキストウィンドウと、グローバルキャッシュのフットプリントをトークンあたり890バイトに削減するFP4 KVキャッシュを備えたマルチモーダルMixture-of-ExpertsモデルであるDeepSeek-V4.1-Flashをリリースしました。このモデルは、因果的なエンコーダ・デコーダアーキテクチャとCompressed Sparse Attention 2 (CSA2) を活用し、パフォーマンスを維持しながらメモリ要件を大幅に削減しています。

media MarkTechPost · 27日前 ARC-AGI 3 · 99.9% · 59 回表示

OpenAIが105万トークンのコンテキストを持つコンピュータ操作モデル「GPT-6 Astra」をリリース

OpenAIは、チャットモデルではなく主にコンピュータ操作システムとして位置づけられたクローズドでホストされたモデルであるGPT-6 Astraをリリースした。これはブラウザ、スプレッドシート、ターミナル間でソフトウェアを操作して多段階のタスクを完了し、1,050,000トークンのコンテキストウィンドウと2026年4月30日までの知識カットオフを特徴とする。

media MarkTechPost · 27日前 GDPval-AA (Elo) · 1754.0Elo · 52 回表示

Meta、ツール呼び出しとトークンを削減した Muse Spark 1.3 をリリース

Meta Superintelligence Labs は、単一ターン生成ではなく長期ワークフロー用に設計されたエージェント型コーディングモデルである Muse Spark 1.3 をリリースしました。このアップデートは Muse Code と Meta Model API で利用可能になり、重みはクローズドのまま維持しつつ、1M トークンのコンテキストウィンドウを搭載しています。

media MarkTechPost · 28日前 · 63 回表示

Google DeepMindがGemini 3.8 Flashとゲート型Flash Cyberバリアントをリリース

Google DeepMindは、基盤アーキテクチャを共有しつつ、安全範囲とアクセス制御が異なる2つの新しいモデルバリアント、Gemini 3.8 FlashおよびGemini 3.8 Flash Cyberをリリースした。標準のGemini 3.8 FlashはGemini APIやその他のGoogleプラットフォームを通じて一般公開されている一方、CyberバリアントはFairwindプログラムを通じて審査された防衛者だけに制限されている。

media MarkTechPost · 7時間前

NVIDIAの研究者がCosmos 3動画モデルの物理推論を改善するPhysis-Langを公開

NVIDIA、MIT、オックスフォード大学の研究者らは、自己進化型の物理言語をキャプションに統合することで動画の世界モデルを強化するフレームワーク「Physis-Lang」を発表した。この手法は、生成された動画の物理エラーを修正するために、データ選別、モデル学習、推論に使用される最適化可能な表現として物理言語を取り扱う。

media MarkTechPost · 13時間前 · 3 回表示

Liquid AIがゼロ出力トークンで補正済み確率を返す意思決定モデルd1をリリース

Liquid AIは、テキスト生成ではなく構造化された選択のために設計された意思決定モデルであるd1をリリースした。このモデルはコンテキストと型付き質問を受け取り、単一の呼び出しで固定された結果に対して補正済み確率を返す。生成される出力トークンはゼロである。

media MarkTechPost · 1日前 Android World · 85.1% · 8 回表示

H社がデスクトップ、Web、モバイル向けのHolo4オープンウェイトコンピュータ操作モデルをリリース

H社は、デスクトップ、Web、Android、API環境でクリック、入力、コード記述、ツール呼び出しを行うために設計された汎用コンピュータ操作ビジョン言語モデルのファミリーであるHolo4をリリースした。今回のリリースには2つのモデルサイズが含まれる:Holo4 27B(デンス)とHolo4 35B-A3B(エキスパート混合、アクティブパラメータ3B)。どちらも256Kのコンテキストウィンドウをサポートする。

media MarkTechPost · 1日前 SWE-bench Verified · 79.0% · 7 回表示

Google Research、AIエージェントのハーネス過学習を防ぐRRSIを公開

Google Cloud AI Researchは、UNCチャペルヒル校、スタンフォード大学、ワシントン大学セントルイス校と共同で、RRSI(Regularized Recursive Self-Improvement)をオープンソース化した。このフレームワークにより、LLMエージェントはモデルの重みを変更せずに、プロンプト、ツール、メモリ、制御フロー、サブエージェントを含む自身のハーネスを書き換えることができる。

media MarkTechPost · 1日前 · 3 回表示

アリババのQwenチームが全二重音声モデル「Qwen-Audio-3.1-Realtime」をリリース

アリババのQwenチームは、新しいQwen-Audio-3.1-Realtime-plusを含む5つのモデルからなるオーディオスタックであるQwen-Audio-3.1をリリースしました。これは、推論やツール使用が可能な音声エージェント向けに設計された全二重音声モデルです。また、本リリースではASRサービスの料金が最大95%引き下げられました。

media MarkTechPost · 2日前 · 9 回表示

NVIDIAがOpenShellとSentryを用いたオープンエージェント安全プラットフォームを発売

NVIDIAは、AIエージェントのセキュリティのためのオープンソフトウェアプラットフォームである「NVIDIA Open Agent Safety Platform」を発売した。これは、OpenShellの安全なランタイムと、BlueField-4 DPU上のアウトオブバンド監視装置であるSentryを組み合わせたものである。本システムは、エージェントがアプリケーション層の制御を回避するという失敗モードである「ドリフト」を防ぐために、安全対策のエージェントからのアクセス不可能な領域に配置することを目的としている。