OpenAIは、コーディング、事実性、コンピュータ操作、専門タスクにおける進歩を低コストモデルにもたらすため、GPT-6 Astraのより高速で手頃な価格の代替としてGPT-6 SolとLunaを発表した。
- AnthropicはClaude Opus 5.5をリリースし、ほとんどの作業においてClaude Fable 5.1に匹敵する性能を実現しつつ、Opus 5よりも実行コストが40%削減された。
- SWE-Bench Pro V2が11のリポジトリ由来の642タスクでリリースされ、以前のタスクエラーを修正し評価プロセスを最適化した。
- Googleは、AIエージェントが自己改善を再帰的に活用する方法を正則化しベンチマーク過適合を軽減する手法RRSIを発表した。
これらのアップデートにより、ユーザーはよりコスト効果の高いモデルオプションと、AI性能を評価するための厳格な新ベンチマークを利用できるようになった。