Moonshot AIが公開するオープンウェイトモデルであるKimi K3は、DeepSWEベンチマークにおいてAnthropicのClaude Fable 5と同等のパフォーマンスを発揮し、タスクあたりのコストを大幅に抑えています。2026年7月16日の評価では、Kimi K3はpass@1で68.5%を達成し、Fable 5の69.9%には及びませんでしたが、複数回の試行シナリオではこれを上回り、コスト効率においても優れていました。
- Kimi K3のロールアウトあたりのコストは4.65ドルで、Claude Fable 5の13.41ドルに対して、1ドルあたりに解決できるタスク数が2.8倍多くなります。
- Fable 5は単一試行の信頼性(69.9%対68.5%)で優れていますが、Kimi K3はpass@2(82.0%対80.2%)とpass@4(89.4%対88.5%)で勝利しています。
- Kimi K3はより広範なタスクをカバーし、107のユニークなタスクを解決したFable 5に対して101のタスクを解決しており、Goにおいて強力なパフォーマンスを示しました。
- 両モデルには高い相関(0.72)があり、失敗パターンも類似しているため、ペアで使用しても大きな多様性は提供されません。
Kimi K3は、オープンウェイトであることと低コストにより、単一試行の信頼性でわずかに優位なFable 5とは対照的に、高ボリュームまたは再試行許容型のエージェントワークにおいてデフォルトの合理的な選択肢として位置づけられています。