Les actualités IA de cette semaine mettent en lumière d'importantes publications de modèles à poids ouverts par Z.ai, Tencent et Alibaba, ainsi que des avancées dans l'infrastructure d'inférence et l'évaluation des agents.
- Z.ai a publié GLM-5.3 avec 744B paramètres au total pour le codage agentique et la cybersécurité, tandis que sa variante Flash offre une qualité supérieure à moindre coût.
- Tencent a lancé Hy4-preview, un modèle MoE de 770B qui présente des gains de performance substantiels par rapport à Hy3 dans les tâches de génération de code.
- Alibaba a introduit Qwen3.8-Flash, un modèle MoE de 125B conçu pour une inférence multimodale longue contexte à faible coût, bien que les premiers rapports signalent des problèmes de stabilité avec la quantisation FP8.
- vLLM a publié des benchmarks comparant les méthodes de décodage spéculatif, ne trouvant aucun gagnant universel et soulignant l'importance du réglage spécifique à la charge de travail.
- Alibaba Accio a ouvert CommerceAgentBench, un benchmark de 107 tâches mesurant l'achèvement réel des tâches plutôt que simplement la qualité de la réponse.
- La recherche de Google indique que les compétences portables stockées dans un wiki persistant se transfèrent efficacement entre les familles de modèles, offrant potentiellement des capacités d'agent plus robustes que le fine-tuning.