Base-10のチャーリー・オニールは、Dwarkesh Patelとの最近のエピソードで、KimiとGLMモデルが「ほぼ客観的に」Opus 5よりも優れている理由について議論した。
この議論はAIの進歩に対する懐疑論に焦点を当て、研究者たちがデータの頭打ちではなく、多くの容易な成果を見つけたことを示唆している。また、Patelが懐疑論から業界がAGIとRSIの創造に向けて順調に進んでいるという信念へと転換した点も扱っている。
Base-10のチャーリー・オニールは、Dwarkesh Patelとの最近のエピソードで、KimiとGLMモデルが「ほぼ客観的に」Opus 5よりも優れている理由について議論した。
この議論はAIの進歩に対する懐疑論に焦点を当て、研究者たちがデータの頭打ちではなく、多くの容易な成果を見つけたことを示唆している。また、Patelが懐疑論から業界がAGIとRSIの創造に向けて順調に進んでいるという信念へと転換した点も扱っている。
DeepSWEベンチマークにおけるGLM-5.3とGPT-5.6 Solの比較分析により、カスケードルーティング戦略が単独で使用されるいずれかのモデルを上回ることを示した。まずGLM-5.3を実行し、テスト失敗時のみGPT-5.6 Solにエスカレーションすることで、システムはタスクあたり$6.61で85.9%のタスクを解決する。
DeepSWEベンチマークにおけるKimi K3とGPT-5.6 Solの比較により、GPT-5.6 Solが一発での品質(72.7%対68.5%)でリードしているものの、Kimi K3はk > 1に対してpass@kスコアをより高いコスト効率で達成することが明らかになった。
Moonshot AIのKimi K3、DeepSeek V4 Pro、Zhipu AIのGLM-5.2という3つのオープンウェイトなスパースMixture-of-Expertsモデルの比較は、長期のコーディングおよびエージェントワークロードにおけるその能力、ライセンス条項、推論コストを評価するものである。
広く使用されている6つの物理ベンチマークを監査した研究によると、最先端言語モデルの低いスコアは主にモデルの欠陥ではなくベンチマークの実施誤りに起因していることが明らかになった。専門家は問題文、正解解答、モデルの回答を検討し、実際の誤答と採点者のミス、不正解の参考解答、曖昧な質問を区別した。
Cognitionは、Moonshot AIの2.8TパラメータオープンモデルKimi K3を用いた強化学習による後期学習を経て、現時点で最も高性能なコーディングモデルであるSWE-2をリリースした。このモデルはFrontierCode 1.1 Mainで50.0%のスコアを記録し、コストが64%削減された状態でFable 5.1にわずか1ポイント差で迫っている。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー