PP-OCRv6, un nouveau modèle de reconnaissance optique de caractères (OCR), est désormais disponible sur Hugging Face. Il prend en charge 50 langues et s'étend de 1,5 million à 34,5 millions de paramètres, offrant une précision et une efficacité améliorées pour diverses langues.
PP-OCRv6 disponible sur Hugging Face avec prise en charge de 50 langues
Google publie le rapport technique de DiffusionGemma
Google a publié un rapport technique sur DiffusionGemma, disponible sur arXiv. Le document détaille l'architecture et les capacités du modèle dans le cadre de la famille Gemma.
Microsoft publie Mage-Flow, un modèle natif de 4B pour la génération et l'édition d'images
Microsoft a publié Mage-Flow, une pile générative compacte à échelle 4B conçue pour la génération texte-vers-image efficace et l'édition d'images basée sur des instructions. Le système atteint une qualité compétitive avec les meilleurs résultats grâce à la co-conception d'un tokenizeur léger, Mage-VAE, et d'un Transformateur de Diffusion Multimodale à Résolution Native (NR-MMDiT).
SenseNova publie les modèles open source SenseNova-U1-8b-MoT pour la conception d'infographies
SenseNova a publié la série SenseNova-U1-8b-MoT, un ensemble de modèles Mixture of Transformers conçus pour générer et éditer des infographies denses. La dernière version, Infographic V2, sert de modèle de base à 50 étapes sous licence Apache 2.
Les modèles IA d'Alibaba surpassent Meta et Google avec 3 milliards de téléchargements sur Hugging Face
Selon le rapport « State of Open Models: Summer 2026 Observations » de Hugging Face, les modèles IA d'Alibaba ont atteint un total cumulé de 3 milliards de téléchargements sur la plateforme. Cette étape marque un changement significatif dans le paysage du code ouvert, car Alibaba a désormais dépassé à la fois Meta et Google en nombre total de téléchargements de modèles.
Z.ai lance GLM-5.3 avec un post-apprentissage étendu
Z.ai a annoncé GLM-5.3, un nouveau modèle qui atteint des performances de pointe sur les benchmarks de codification agentic en étendant le post-apprentissage de son modèle de base GLM-5.2. Le modèle de ~750B paramètres dépasse actuellement Kimi K3 et égale ou dépasse Claude Fable 5 et GPT-5.6-Sol sur divers benchmarks.