Benchmark results
media MarkTechPost · たった今 DeepSWE · 68.8% · 1 回表示 ライブ

OpenAIがGPT-6 SolとLunaをAPI価格50%引きでリリース

OpenAIは、OpenAI APIで利用可能になった2つの新モデル、GPT-6 SolとGPT-6 Lunaをリリースした。これらのモデルは、以前にリリースされたGPT-6 Astraの下位に位置し、複雑なコーディングや大量の日常業務向けに、より高速で手頃なティアへ技術的進歩をもたらすことを目的としている。

media Latent Space · たった今 · 4 回表示 ライブ

AnthropicがClaude Opus 5.5をリリース、文章力が向上しコストも削減

Anthropicは、新しいClaude 5.5ファミリーの最初のモデルであるClaude Opus 5.5をリリースしました。これは以前の世代に対するより効率的な代替手段として位置づけられています。このモデルは、Opus 5の実行コストと比較して40%低く抑えながら、ほとんどのタスクにおいてClaude Fable 5.1のレベルでパフォーマンスを発揮するように設計されています。

lab Hugging Face Blog · 15時間前 · 9 回表示

AISIが5つのベンチマークにおける6つの最先端モデルの検証済み評価結果を公開

英国AIセキュリティ研究所(AISI)は、ベンチマークの再現性を向上させるため、EvalEvalのEvaluation Cardsプラットフォームを通じて公に報告された評価手法と知見を公開しました。今回のリリースには、HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro、Terminal-Bench 2.0という5つの特定のベンチマークに関する検証済み結果、文脈、および設定情報が含まれています。

media MarkTechPost · 21時間前 GDPval-AA (Elo) · 1695.0Elo · 13 回表示

SpaceXAIがGrok 4.7をリリース、より大規模なベースモデルと改善されたベンチマーク

SpaceXAIは、Grok 4.6と比較してより大規模なベースモデルと拡張された強化学習ランを用い、コーディング、エージェントタスク、ナレッジワーク向けの新しいフラッグシップモデルであるGrok 4.7をリリースした。このモデルは、前任者と同じ価格構造を維持しつつ、自己検証、長文脈処理、安全性の面で強化された機能を提供する。

media Interconnects · 2日前 Artificial Analysis Intelligence Index · 45.0% · 17 回表示

中国のオープンウェイトモデルがダウンロード数とベンチマークで米国の競合を凌駕

著者はオープンウェイトモデルの現状に関するブリーフィングを提示し、2025年4月頃以降、中国のAI企業がこの分野で明確なリーダーとなっていることを指摘している。この変化は、Hugging Faceのダウンロード指標と能力ベンチマークでのパフォーマンスによって裏付けられている。

media Hugging Face Forums · 6日前 · 13 回表示

エージェント浪費インデックスが34万1054件の公開コーディングエージェント実行を浪費パターンでスコアリング

エージェント浪費インデックスは、11の公開データセットから34万1054件のエージェント軌道をスコアリングし、ループ、盲目的な再試行、過大なツール出力、放棄された実行などの非効率性を特定した。分析により、ループと再試行の挙動はLlamaエージェントのような弱めのモデルでは一般的であるが、Claude 3.7 SonnetやQwen3-Coder-480Bでは稀であることが明らかになった。

media MarkTechPost · 7日前 LMSYS Arena (Elo) · 1866.0Elo · 20 回表示

Prior LabsがTabPFN-3.5をリリース、デフォルト設定で2015年Otto Kaggle優勝モデルを上回る

Prior Labsは、データセットごとの学習やチューニングなしに単一の順伝播で表形式データに対する予測を行う表形式ファウンデーションモデル「TabPFN-3.5」をリリースした。このモデルは、2015年Otto Group Product Classification Challengeのプライベートリーダーボードで0.375のスコアを記録し、Gilberto TitericzとStanislav Semenovが達成した元の優勝スコア0.382を上回った。

media MarkTechPost · 7日前 · 28 回表示

Nums AIがCausiloをリリース、単一モデルの中でTabArenaでトップの表形基礎モデル

Nums AIは、分類と回帰のための事前学習済み表形基礎モデルであるCausiloをリリースしました。このモデルは、TabArenaにおいて単一モデルの中で最も高いEloスコアを達成しています。Causiloは、トレーニング行を重み更新ではなくコンテキストとして保存するインコンテキストラーニングのアプローチを採用しており、Apache-2.0ライセンスのコードと事前学習済みウェイトがHugging Faceで公開されています。

arxiv arXiv cs.CL · 8日前 Codeforces (Elo) · 98.2% · 27 回表示

Stellar Colosseumがマルチエージェント推論を活用して長期の数学研究を支援

Stellar Colosseumは、数学および理論計算機科学における長期の研究に対して推論を割り当てるために設計されたモデル非依存のハーンであり、複雑な問題に対する言語モデルの信頼性の低さに対処する。このシステムは証明構築の前に代替戦略を探査し、準備状態ゲートを使用してルートが分解に十分な成熟度を持っているかを判断し、証明計画を相互依存的なセクションレベルのサブ問題として表現する。

arxiv arXiv cs.LG · 8日前 Codeforces (Elo) · 98.2% · 25 回表示

Stellar Colosseum: 数学およびTCS研究における長期ホリズンのためのマルチエージェントハーネス

著者らは、Stellar Colosseumを提案する。これは、数学および理論計算機科学における長期ホリズンの研究に対して推論を割り当てるために設計されたモデル非依存のハーネスである。本システムは、証明構築の前に代替戦略を検索し、準備状態ゲートを使用して分解に適したルートが成熟したかどうかを判断し、証明計画を相互依存的なセクションレベルの部分問題として表現する。

arxiv arXiv cs.AI · 9日前 · 25 回表示

専門家の再採点により、最先端モデルは物理ベンチマークでほぼ飽和状態にあることが判明

広く使用されている6つの物理ベンチマークを監査した研究によると、最先端言語モデルの低いスコアは主にモデルの欠陥ではなくベンチマークの実施誤りに起因していることが明らかになった。専門家は問題文、正解解答、モデルの回答を検討し、実際の誤答と採点者のミス、不正解の参考解答、曖昧な質問を区別した。

lab Cohere Blog · 10日前 · 35 回表示

Cohereが主権的なオープンウェイト機械翻訳モデル「North Small Translate」をリリース

Cohereは、CC BY-NC 4.0ライセンスの下で研究および非商用利用が可能となる、Northシリーズ初の翻訳モデルであるNorth Small Translateをリリースした。このMoE(Mixture-of-Experts)モデルは、WMT26 All Languagesベンチマークで83.6のスコアを達成し、DeepL NextGenやGoogle Translateなどのプロプライエタリモデルを上回る性能を示している。

media MarkTechPost · 10日前 Terminal-Bench 2 · 92.8% · 28 回表示

Cognitionが選択可能な推論コストを備えたKimi K3後期学習コーディングモデルSWE-2をリリース

Cognitionは、Moonshot AIの2.8TパラメータオープンモデルKimi K3を用いた強化学習による後期学習を経て、現時点で最も高性能なコーディングモデルであるSWE-2をリリースした。このモデルはFrontierCode 1.1 Mainで50.0%のスコアを記録し、コストが64%削減された状態でFable 5.1にわずか1ポイント差で迫っている。

lab NVIDIA Research · 11日前 · 16 回表示

ReasoningBombは大型推論モデルに病的に長い推論を引き起こす

研究者らは、大型推論モデル(LRM)における明示的な多段階推論の高い計算コストを悪用する、推論時のサービス拒否(PI-DoS)攻撃を形式化しました。彼らは、被害者モデルを病的に長く、しばしば終了しない推論トレースへと駆り立てる短い自然言語プロンプトを生成する攻撃者を訓練する、強化学習ベースのフレームワークであるReasoningBombを発表します。