Grok 4.6はバイオセキュリティ拒否で首位を維持しつつ、通常の生物学的パフォーマンスも確保
LatchBioがGrok 4.6のBioSecBench-RefusalおよびBioSecBench-Surveillanceベンチマークにおける独立分析を発表し、同モデルがテストされた最先端システムの中で隠蔽された危険なタスクを拒否する能力で最も優れていることを明らかにした。
LatchBioがGrok 4.6のBioSecBench-RefusalおよびBioSecBench-Surveillanceベンチマークにおける独立分析を発表し、同モデルがテストされた最先端システムの中で隠蔽された危険なタスクを拒否する能力で最も優れていることを明らかにした。
研究者らは、大型推論モデル(LRM)における明示的な多段階推論の高い計算コストを悪用する、推論時のサービス拒否(PI-DoS)攻撃を形式化しました。彼らは、被害者モデルを病的に長く、しばしば終了しない推論トレースへと駆り立てる短い自然言語プロンプトを生成する攻撃者を訓練する、強化学習ベースのフレームワークであるReasoningBombを発表します。
NVIDIAは、トレーニングや特徴エンジニアリングを必要とせず、コンテキスト内学習を通じて動作する表形式の分類および回帰用のオープンなファウンデーションモデルであるKumo Tabularをリリースした。構造化因果モデルによって生成された人工データのみで事前学習されており、28Mから215Mパラメータの3つのサイズで提供されている。
AnthropicはClaude 5.5ファミリーの2番目のモデルであるClaude Sonnet 5.5をリリースしました。これは日常のタスク、バグ修正、ドキュメントの推敲においてClaude Opus 5.5のより高速でコスト効果の高い補完的存在として位置づけられています。
Anthropicは、Claude 5.5ファミリーの最初のモデルであるClaude Opus 5.5を発表しました。このモデルは、Opus 5よりも実行コストが40%安く、ほとんどのタスクでClaude Fable 5.1と同等のパフォーマンスを提供します。
Anthropicは、Claude Opus 5の低コスト後継であるClaude Opus 5.5をリリースした。これはArtificial AnalysisのIntelligence Index v4.3およびVals AIのVals Indexで総合知能ベンチマークにおいて首位を獲得している。同時に、OpenAI出身者のDiogo Almeidaによって設立されたTypeSafeは、大規模言語モデルよりも低コストでテキストを分析し、事前に定義された出力を返すために設計された汎用分類モデルであるJevを発表した。
OpenAIは、コーディング、事実性、コンピュータ操作、専門タスクにおける進歩を低コストモデルにもたらすため、GPT-6 Astraのより高速で手頃な価格の代替としてGPT-6 SolとLunaを発表した。
OpenAIは、OpenAI APIで利用可能になった2つの新モデル、GPT-6 SolとGPT-6 Lunaをリリースした。これらのモデルは、以前にリリースされたGPT-6 Astraの下位に位置し、複雑なコーディングや大量の日常業務向けに、より高速で手頃なティアへ技術的進歩をもたらすことを目的としている。
Anthropicは、新しいClaude 5.5ファミリーの最初のモデルであるClaude Opus 5.5をリリースしました。これは以前の世代に対するより効率的な代替手段として位置づけられています。このモデルは、Opus 5の実行コストと比較して40%低く抑えながら、ほとんどのタスクにおいてClaude Fable 5.1のレベルでパフォーマンスを発揮するように設計されています。
Anthropicは、Claude 5.5ファミリーの新モデル第1弾であるClaude Opus 5.5をリリースした。これはほとんどの作業においてClaude Fable 5.1レベルのパフォーマンスを発揮し、Opus 5の実行コストよりも40%低い。
SpaceXAIは、Grok 4.6と比較してより大規模なベースモデルと拡張された強化学習ランを用い、コーディング、エージェントタスク、ナレッジワーク向けの新しいフラッグシップモデルであるGrok 4.7をリリースした。このモデルは、前任者と同じ価格構造を維持しつつ、自己検証、長文脈処理、安全性の面で強化された機能を提供する。
OpenAIは、主要なAIリーダーボードでトップまたはそれに準じる順位を達成しつつ、競合モデルよりも大幅に少ないトークン数で使用し、コストを抑えた新しいフラッグシップビジョン言語モデルであるGPT-6 Astraをリリースしました。このモデルはOpenAIの重要セキュリティ基準を満たすように設計されており、高度なサイバー機能は選択された組織にのみ制限されています。
OpenAIは公式にGPT-6 Astraをリリースし、これまでの最も知的でアライメントされたモデルとして位置づけています。ロールアウトはコンピュータ使用、ソフトウェアエンジニアリング、数学と科学、オフィスワーク、サイバーセキュリティを対象としています。
OpenAIは、ChatGPT Plus、Pro、Business、Enterpriseユーザー向けに利用可能な新モデル「GPT-6 Astra」をリリースした。また、OpenAI APIおよびAWS経由でも提供されている。このモデルの入力トークン100万個あたり10ドル、出力トークン100万個あたり50ドルで価格設定されており、Claude Fable 5に対する競合ポジションに位置づけられている。
Anthropicは、コーディングおよびナレッジワークのための新たなフラッグシップモデルとしてClaude Fable 5.1とClaude Mythos 5.1をリリースし、自律的なマルチステップタスクにおいて世界で最も先進的なモデルであることを位置づけている。
Anthropicは、コーディングおよびナレッジワークのための新フラッグシップモデルとしてClaude Fable 5.1とClaude Mythos 5.1をリリースし、自律的なマルチステップタスクに対応可能であることをアピールした。今回のリリースでは、キャッシュ読み込み価格が100万トークンあたり0.25ドルに大幅引き下げされ、100万トークンのコンテキストウィンドウもサポートされている。
AnthropicはClaude Fable 5.1と制限付きのClaude Mythos 5.1をリリースした。両者は基盤となるモデルを共有しているが、セーフガードレイヤーが異なる。
NVIDIA、MIT、オックスフォード大学の研究者らは、自己進化型の物理言語をキャプションに統合することで動画の世界モデルを強化するフレームワーク「Physis-Lang」を発表した。この手法は、生成された動画の物理エラーを修正するために、データ選別、モデル学習、推論に使用される最適化可能な表現として物理言語を取り扱う。
AI Compute Radarは、46の追跡対象オープンモデルのうち15ラボをランク付けする「メーカーボード」を発表し、ヒートスコアと呼ばれる複合指標を使用している。このランキングは各ラボがトップ10に入っているモデルの数によって決定され、同点の場合は最上位の順位と30日間の合計ダウンロード数で決着をつける。
AnthropicのFrontier Red Teamは、内部Binary Exploitationベンチマークの100タスクで中国製モデルGLM-5.3を評価し、4%の試行で完全な制御フローハイジャックを開発できることを発見しました。