OpenAIがGPT-6 SolとLunaをAPI価格50%引きでリリース
OpenAIは、OpenAI APIで利用可能になった2つの新モデル、GPT-6 SolとGPT-6 Lunaをリリースした。これらのモデルは、以前にリリースされたGPT-6 Astraの下位に位置し、複雑なコーディングや大量の日常業務向けに、より高速で手頃なティアへ技術的進歩をもたらすことを目的としている。
OpenAIは、OpenAI APIで利用可能になった2つの新モデル、GPT-6 SolとGPT-6 Lunaをリリースした。これらのモデルは、以前にリリースされたGPT-6 Astraの下位に位置し、複雑なコーディングや大量の日常業務向けに、より高速で手頃なティアへ技術的進歩をもたらすことを目的としている。
Anthropicは、新しいClaude 5.5ファミリーの最初のモデルであるClaude Opus 5.5をリリースしました。これは以前の世代に対するより効率的な代替手段として位置づけられています。このモデルは、Opus 5の実行コストと比較して40%低く抑えながら、ほとんどのタスクにおいてClaude Fable 5.1のレベルでパフォーマンスを発揮するように設計されています。
Anthropicは、Claude 5.5ファミリーの新モデル第1弾であるClaude Opus 5.5をリリースした。これはほとんどの作業においてClaude Fable 5.1レベルのパフォーマンスを発揮し、Opus 5の実行コストよりも40%低い。
英国AIセキュリティ研究所(AISI)は、ベンチマークの再現性を向上させるため、EvalEvalのEvaluation Cardsプラットフォームを通じて公に報告された評価手法と知見を公開しました。今回のリリースには、HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro、Terminal-Bench 2.0という5つの特定のベンチマークに関する検証済み結果、文脈、および設定情報が含まれています。
SpaceXAIは、Grok 4.6と比較してより大規模なベースモデルと拡張された強化学習ランを用い、コーディング、エージェントタスク、ナレッジワーク向けの新しいフラッグシップモデルであるGrok 4.7をリリースした。このモデルは、前任者と同じ価格構造を維持しつつ、自己検証、長文脈処理、安全性の面で強化された機能を提供する。
著者はオープンウェイトモデルの現状に関するブリーフィングを提示し、2025年4月頃以降、中国のAI企業がこの分野で明確なリーダーとなっていることを指摘している。この変化は、Hugging Faceのダウンロード指標と能力ベンチマークでのパフォーマンスによって裏付けられている。
エージェント浪費インデックスは、11の公開データセットから34万1054件のエージェント軌道をスコアリングし、ループ、盲目的な再試行、過大なツール出力、放棄された実行などの非効率性を特定した。分析により、ループと再試行の挙動はLlamaエージェントのような弱めのモデルでは一般的であるが、Claude 3.7 SonnetやQwen3-Coder-480Bでは稀であることが明らかになった。
Mozillaのレポートによると、中国のオープンウェイトAIモデルの開発ギャップは米国最先端製品に対してわずか4ヶ月にまで縮小した。この急速な進歩にもかかわらず、モデルはいくつかのベンチマーク評価で依然として遅れを取っている。
Qwen3.8 Max (0902)モデルは、Artificial Analysisインテリジェンス指数で45点を達成し、中国のリーダーボードでトップの座を奪還しました。
Prior Labsは、データセットごとの学習やチューニングなしに単一の順伝播で表形式データに対する予測を行う表形式ファウンデーションモデル「TabPFN-3.5」をリリースした。このモデルは、2015年Otto Group Product Classification Challengeのプライベートリーダーボードで0.375のスコアを記録し、Gilberto TitericzとStanislav Semenovが達成した元の優勝スコア0.382を上回った。
Mozillaのレポートによると、中国と米国の人工知能モデル間の能力差は大幅に縮小し、4.4ヶ月の違いにまで減少しました。
Nums AIは、分類と回帰のための事前学習済み表形基礎モデルであるCausiloをリリースしました。このモデルは、TabArenaにおいて単一モデルの中で最も高いEloスコアを達成しています。Causiloは、トレーニング行を重み更新ではなくコンテキストとして保存するインコンテキストラーニングのアプローチを採用しており、Apache-2.0ライセンスのコードと事前学習済みウェイトがHugging Faceで公開されています。
Stellar Colosseumは、数学および理論計算機科学における長期の研究に対して推論を割り当てるために設計されたモデル非依存のハーンであり、複雑な問題に対する言語モデルの信頼性の低さに対処する。このシステムは証明構築の前に代替戦略を探査し、準備状態ゲートを使用してルートが分解に十分な成熟度を持っているかを判断し、証明計画を相互依存的なセクションレベルのサブ問題として表現する。
著者らは、Stellar Colosseumを提案する。これは、数学および理論計算機科学における長期ホリズンの研究に対して推論を割り当てるために設計されたモデル非依存のハーネスである。本システムは、証明構築の前に代替戦略を検索し、準備状態ゲートを使用して分解に適したルートが成熟したかどうかを判断し、証明計画を相互依存的なセクションレベルの部分問題として表現する。
Base-10のチャーリー・オニールは、Dwarkesh Patelとの最近のエピソードで、KimiとGLMモデルが「ほぼ客観的に」Opus 5よりも優れている理由について議論した。
広く使用されている6つの物理ベンチマークを監査した研究によると、最先端言語モデルの低いスコアは主にモデルの欠陥ではなくベンチマークの実施誤りに起因していることが明らかになった。専門家は問題文、正解解答、モデルの回答を検討し、実際の誤答と採点者のミス、不正解の参考解答、曖昧な質問を区別した。
DeepSeek V4.1 Flash は、Artificial Analysis Intelligence Index v4.3 のアップデートにおいて、新しい Astra ベンチマークで第1位となりました。
Cohereは、CC BY-NC 4.0ライセンスの下で研究および非商用利用が可能となる、Northシリーズ初の翻訳モデルであるNorth Small Translateをリリースした。このMoE(Mixture-of-Experts)モデルは、WMT26 All Languagesベンチマークで83.6のスコアを達成し、DeepL NextGenやGoogle Translateなどのプロプライエタリモデルを上回る性能を示している。
Cognitionは、Moonshot AIの2.8TパラメータオープンモデルKimi K3を用いた強化学習による後期学習を経て、現時点で最も高性能なコーディングモデルであるSWE-2をリリースした。このモデルはFrontierCode 1.1 Mainで50.0%のスコアを記録し、コストが64%削減された状態でFable 5.1にわずか1ポイント差で迫っている。
研究者らは、大型推論モデル(LRM)における明示的な多段階推論の高い計算コストを悪用する、推論時のサービス拒否(PI-DoS)攻撃を形式化しました。彼らは、被害者モデルを病的に長く、しばしば終了しない推論トレースへと駆り立てる短い自然言語プロンプトを生成する攻撃者を訓練する、強化学習ベースのフレームワークであるReasoningBombを発表します。