Kimi K3, un modèle à poids ouverts de Moonshot AI, atteint des performances comparables à celles de Claude Fable 5 d'Anthropic sur le benchmark DeepSWE tout en coûtant nettement moins par tâche. Lors d'une évaluation du 16 juillet 2026, Kimi K3 a obtenu un taux de réussite pass@1 de 68,5 % contre 69,9 % pour Fable 5, mais l'a surpassé dans les scénarios à multiples tentatives et a offert une efficacité coûts supérieure.

  • Kimi K3 coûte 4,65 $ par rollout contre 13,41 $ pour Claude Fable 5, offrant 2,8 fois plus de tâches résolues par dollar.
  • Bien que Fable 5 mène en fiabilité à tentative unique (69,9 % contre 68,5 %), Kimi K3 remporte le pass@2 (82,0 % contre 80,2 %) et le pass@4 (89,4 % contre 88,5 %).
  • Kimi K3 couvre un éventail plus large de tâches, résolvant 101 tâches uniques contre 107 pour Fable 5, avec des performances solides en Go.
  • Les modèles montrent une forte corrélation (0,72) et des schémas d'échec similaires, ce qui signifie qu'ils ne fournissent pas une diversité significative lorsqu'ils sont couplés.

Kimi K3 est positionné comme un choix par défaut rationnel pour les travaux d'agents à fort volume ou tolérants aux retries en raison de sa nature à poids ouverts et de son coût inférieur, malgré l'avantage léger de Fable 5 en fiabilité à tentative unique.