Deux paramètres API ont triplé les scores de GPT-5.6 sur ARC-AGI-3
L'activation de deux paramètres API spécifiques pour GPT-5.6 a entraîné un triplement de ses scores de performance sur le benchmark ARC-AGI-3.
L'activation de deux paramètres API spécifiques pour GPT-5.6 a entraîné un triplement de ses scores de performance sur le benchmark ARC-AGI-3.
Z.ai a annoncé GLM-5.3, un nouveau modèle qui atteint des performances de pointe sur les benchmarks de codification agentic en étendant le post-apprentissage de son modèle de base GLM-5.2. Le modèle de ~750B paramètres dépasse actuellement Kimi K3 et égale ou dépasse Claude Fable 5 et GPT-5.6-Sol sur divers benchmarks.
Une comparaison entre DeepSeek-V4 Flash 0731 et GPT-5.6 Luna sur le benchmark DeepSWE révèle que, bien que GPT-5.6 Luna soit l'ingénieur le plus performant, une stratégie en cascade utilisant les deux modèles atteint une précision supérieure à un coût moindre.
Alibaba a annoncé Qwen3.8-Max comme son nouveau modèle phare, le décrivant comme une architecture sparse de 2,4T de paramètres axée sur les travaux agents à long terme, la programmation et le raisonnement multimodal. L'entreprise a confirmé que les poids ouverts pour Qwen3.8-Max seront publiés la semaine prochaine, accompagnés de la variante à poids ouverts Qwen3.8-27B.
DeepSeek a mis à jour son modèle V4 Flash, en publiant une nouvelle version le 2026-07-31 qui affiche des gains de performance significatifs par rapport à la précédente version d'aperçu. La mise à jour introduit des résultats pour plusieurs nouveaux benchmarks tout en améliorant les scores sur ceux existants.
Une comparaison entre Kimi K3 et GPT-5.6 Sol sur le benchmark DeepSWE révèle que, bien que GPT-5.6 Sol domine en qualité en un seul essai (72,7 % contre 68,5 %), Kimi K3 obtient des scores pass@k supérieurs pour k > 1 à un coût nettement inférieur.
Anthropic a lancé le modèle Claude Opus 5, déclenchant un examen de ses performances sur les métriques de codage et de capacités générales ainsi qu'un regain de débat sur l'évaluation des modèles de pointe.
Anthropic a publié Claude Opus 5, un nouveau modèle de pointe qui a suscité d'importants débats sur les scores aux benchmarks et les performances pratiques. Des évaluations indépendantes d'Epoch AI rapportent un Epoch Capabilities Index (ECI) de 159 et un SWE-ECI de 161 pour le nouveau modèle.
Kimi K3, un modèle à poids ouverts de Moonshot AI, atteint des performances comparables à celles de Claude Fable 5 d'Anthropic sur le benchmark DeepSWE tout en coûtant nettement moins par tâche. Lors d'une évaluation du 16 juillet 2026, Kimi K3 a obtenu un taux de réussite pass@1 de 68,5 % contre 69,9 % pour Fable 5, mais l'a surpassé dans les scénarios à multiples tentatives et a offert une efficacité coûts supérieure.
Sierra Research a publié τ-bench 1.0.1, qui corrige le schéma de notation de la tâche `banking_knowledge` afin d'arrêter de pénaliser les agents pour leurs vérifications prudentes et résout plusieurs incohérences de données. La mise à jour garantit que le re-notage des trajectoires du classement augmente uniquement les scores, sans qu'aucune simulation précédemment validée ne soit défaillante.
Le 16 juillet, Moonshot AI a lancé son dernier modèle phare, Kimi K3, une architecture Mixture of Experts (MoE) avec 2,8 billions de paramètres. L'entreprise a promis de publier les poids du modèle le 27 juillet.
Moonshot a publié Kimi K3, un modèle à poids ouverts qui a déclenché une réévaluation de la proximité des modèles chinois par rapport au front. La publication se caractérise par des performances solides en codage, en tâches agentic et en travail de connaissance à long terme.
Moonshot AI a présenté Kimi K3, un nouveau modèle open-weights de classe frontière comportant 2,8 billions de paramètres au total et des capacités natives d'entrée multimodale. Officiellement positionné comme « Intelligence Frontière Ouverte », le modèle prend en charge une fenêtre de contexte de 1 million de tokens et utilise des composants architecturaux novateurs tels que l'attention Kimi Delta (KDA) et les résidus d'attention pour améliorer l'efficacité.
Moonshot AI a lancé Kimi K3, un modèle open-weights de classe frontalière avec 2,8 billions de paramètres et une entrée multimodale native. Le modèle intègre l'attention Kimi Delta (KDA) pour un décodage plus rapide dans les contextes longs et est positionné pour des flux de travail de codage agentique sur le long terme.
Le laboratoire d'IA chinois Moonshot AI a annoncé Kimi K3, le décrivant comme son modèle le plus performant à ce jour avec 2,8 billions de paramètres. Le modèle est actuellement disponible via le site web et l'API, avec une publication des poids ouverts promise pour le 27 juillet 2026.
DharmaOCR atteint une qualité d'extraction et une stabilité supérieures à celles de Mistral OCR4 et Unlimited-OCR sur le portugais brésilien grâce à un entraînement spécifique au domaine.
Qwen a publié le modèle Qwen3.8-27B, disponible au téléchargement sur ModelScope et Hugging Face.
L'article met en évidence un graphique de la mise à jour Gemini 3.7 Flash montrant que les versions précédentes, en particulier 3.5 et 3.6 Flash, avaient pris du retard par rapport aux modèles plus récents des séries Claude 4.8+ et GPT 5.5+.
Un utilisateur de Reddit met en avant le modèle DeepSeek DSv4 Flash 0731, soulignant ses solides capacités de performance par rapport à son coût. La publication fait référence à l'Artificial Analysis Intelligence Index v4.1.1 pour étayer l'affirmation selon laquelle le modèle offre des performances exceptionnelles.
Un système de génération augmentée par récupération conçu spécifiquement, nommé VITA, destiné aux contextes à revenu faible et intermédiaire, a été évalué face à des grands modèles de langage à usage général sur le benchmark HealthBench. L'étude démontre qu'une conception spécifique au corpus peut maintenir des performances compétitives même lorsque de nouveaux modèles de pointe sont publiés.