Kimi K3は、arena.aiの新しいFullStackリーダーボードで首位となりました。
このモデルは、新しく導入されたベンチマークでトップポジションを達成しました。
Kimi K3は、arena.aiの新しいFullStackリーダーボードで首位となりました。
このモデルは、新しく導入されたベンチマークでトップポジションを達成しました。
あるユーザーは、Sonnet 4.6 を使用して 34 のワンショットプロンプトを実行し、その結果得られた HTML、スクリーンショット、GIF を評価することで、Claude Opus 4.8 に対して Kimi K3 を評価しました。その評価により、Kimi K3 が Opus 4.8 よりも優れた結果を生み出したことが結論付けられました。
DeepSWEベンチマークにおけるKimi K3とGPT-5.6 Solの比較により、GPT-5.6 Solが一発での品質(72.7%対68.5%)でリードしているものの、Kimi K3はk > 1に対してpass@kスコアをより高いコスト効率で達成することが明らかになった。
Moonshot AIが公開するオープンウェイトモデルであるKimi K3は、DeepSWEベンチマークにおいてAnthropicのClaude Fable 5と同等のパフォーマンスを発揮し、タスクあたりのコストを大幅に抑えています。2026年7月16日の評価では、Kimi K3はpass@1で68.5%を達成し、Fable 5の69.9%には及びませんでしたが、複数回の試行シナリオではこれを上回り、コスト効率においても優れていました。
Artificial Analysisによると、Kimi-K3のリリースにより、オープンソースとクローズドソースのAI最前線の間のタイムラグはわずか1.5ヶ月に短縮されました。
Agent Arenaリーダーボードによると、Kimi K3は非視覚タスクにおいてOpusと同等のレベルでパフォーマンスを発揮しています。一部のユーザーはOpusが視覚能力で優位性を持っている可能性を指摘していますが、ランキングは他のユースケースでは同水準であることを示しています。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー