Kimi K3 a atteint la position principale dans l'évaluation SpreadsheetBench 2 d'AfterQuery. Ce résultat le place devant Claude Fable 5 sur ce benchmark spécifique.
Kimi K3 occupe la #1 place sur le SpreadsheetBench 2 d'AfterQuery, surpassant Claude Fable 5
Doctorina surpasse les médecins dans le diagnostic synthétique de soins primaires en polonais
Une étude a comparé le système d'IA clinique Doctorina à huit médecins et quatre modèles de langage frontaliers autonomes sur 150 consultations synthétiques de soins primaires en polonais.
Kimi K3 surpasse Opus 4.8 dans la génération HTML en un seul exemple
Un utilisateur a évalué Kimi K3 par rapport à Claude Opus 4.8 en exécutant 34 prompts en un seul exemple et en évaluant le HTML, les captures d'écran et les GIF résultants à l'aide de Sonnet 4.6. L'évaluation a conclu que Kimi K3 a produit de meilleurs résultats qu'Opus 4.8.
Kimi K3 égale Claude Fable 5 sur la qualité DeepSWE pour un tiers du coût
Kimi K3, un modèle à poids ouverts de Moonshot AI, atteint des performances comparables à celles de Claude Fable 5 d'Anthropic sur le benchmark DeepSWE tout en coûtant nettement moins par tâche. Lors d'une évaluation du 16 juillet 2026, Kimi K3 a obtenu un taux de réussite pass@1 de 68,5 % contre 69,9 % pour Fable 5, mais l'a surpassé dans les scénarios à multiples tentatives et a offert une efficacité coûts supérieure.
Kimi K3 se classe au même niveau qu'Opus en réflexion sur Agent Arena
Selon le classement de l'Agent Arena, Kimi K3 affiche des performances comparables à celles d'Opus dans les tâches non visuelles. Bien que certains utilisateurs notent qu'Opus peut avoir un avantage en capacités visuelles, le classement indique une égalité pour d'autres cas d'utilisation.
Kimi K3 (max) bat Sonnet 5 sur Simple Bench
L'article rapporte que Kimi K3 (max) surpasse Sonnet 5 sur le benchmark Simple Bench.