本記事では、Kimi K3 (max) が Simple Bench ベンチマークで Sonnet 5 よりも優れたパフォーマンスを示したと報じられています。
- Kimi K3 (max) はこの特定の評価において、Sonnet 5 よりも高いスコアを達成しています。
本記事では、Kimi K3 (max) が Simple Bench ベンチマークで Sonnet 5 よりも優れたパフォーマンスを示したと報じられています。
ある研究では、臨床AIシステムDoctorinaを8人の医師と4つのスタンドアロンフロンティア言語モデルと比較し、150件の合成ポルトガル語一次保健相談で行われた。
あるユーザーは、Sonnet 4.6 を使用して 34 のワンショットプロンプトを実行し、その結果得られた HTML、スクリーンショット、GIF を評価することで、Claude Opus 4.8 に対して Kimi K3 を評価しました。その評価により、Kimi K3 が Opus 4.8 よりも優れた結果を生み出したことが結論付けられました。
Moonshot AIが公開するオープンウェイトモデルであるKimi K3は、DeepSWEベンチマークにおいてAnthropicのClaude Fable 5と同等のパフォーマンスを発揮し、タスクあたりのコストを大幅に抑えています。2026年7月16日の評価では、Kimi K3はpass@1で68.5%を達成し、Fable 5の69.9%には及びませんでしたが、複数回の試行シナリオではこれを上回り、コスト効率においても優れていました。
Agent Arenaリーダーボードによると、Kimi K3は非視覚タスクにおいてOpusと同等のレベルでパフォーマンスを発揮しています。一部のユーザーはOpusが視覚能力で優位性を持っている可能性を指摘していますが、ランキングは他のユースケースでは同水準であることを示しています。
Kimi K3はAfterQueryのSpreadsheetBench 2評価で首位を達成しました。この結果により、この特定のベンチマークにおいてClaude Fable 5を上回る位置となりました。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー