Kimi K3 a pris la tête du nouveau classement FullStack sur arena.ai.
Le modèle a atteint la première position dans ce benchmark récemment introduit.
Kimi K3 a pris la tête du nouveau classement FullStack sur arena.ai.
Le modèle a atteint la première position dans ce benchmark récemment introduit.
Un utilisateur a évalué Kimi K3 par rapport à Claude Opus 4.8 en exécutant 34 prompts en un seul exemple et en évaluant le HTML, les captures d'écran et les GIF résultants à l'aide de Sonnet 4.6. L'évaluation a conclu que Kimi K3 a produit de meilleurs résultats qu'Opus 4.8.
Une comparaison entre Kimi K3 et GPT-5.6 Sol sur le benchmark DeepSWE révèle que, bien que GPT-5.6 Sol domine en qualité en un seul essai (72,7 % contre 68,5 %), Kimi K3 obtient des scores pass@k supérieurs pour k > 1 à un coût nettement inférieur.
Kimi K3, un modèle à poids ouverts de Moonshot AI, atteint des performances comparables à celles de Claude Fable 5 d'Anthropic sur le benchmark DeepSWE tout en coûtant nettement moins par tâche. Lors d'une évaluation du 16 juillet 2026, Kimi K3 a obtenu un taux de réussite pass@1 de 68,5 % contre 69,9 % pour Fable 5, mais l'a surpassé dans les scénarios à multiples tentatives et a offert une efficacité coûts supérieure.
Selon Artificial Analysis, le lancement de Kimi-K3 a réduit le délai entre les frontières de l'IA open source et closed source à seulement 1,5 mois.
Selon le classement de l'Agent Arena, Kimi K3 affiche des performances comparables à celles d'Opus dans les tâches non visuelles. Bien que certains utilisateurs notent qu'Opus peut avoir un avantage en capacités visuelles, le classement indique une égalité pour d'autres cas d'utilisation.
Nous utilisons des cookies pour mesurer l'audience et améliorer le site. Vous pouvez accepter ou refuser les cookies analytiques. Politique de confidentialité