Le rapport technique Qwen3 présente la dernière version de la famille de modèles Qwen, avec des architectures denses et Mixture-of-Expert (MoE) ayant des échelles de paramètres allant de 0,6 à 235 milliards. Une innovation majeure est l'intégration du mode de réflexion pour le raisonnement complexe et du mode sans réflexion pour les réponses rapides dans un cadre unifié, éliminant ainsi la nécessité de basculer entre différents modèles.

  • Qwen3 introduit un mécanisme de budget de réflexion qui permet aux utilisateurs d'allouer adaptativement les ressources informatiques pendant l'inférence pour équilibrer latence et performance.
  • La série de modèles atteint des résultats de pointe sur divers benchmarks, y compris la génération de code, le raisonnement mathématique et les tâches d'agent.
  • Le support multilingue passe de 29 à 119 langues et dialectes par rapport à son prédécesseur Qwen2.5.
  • Tous les modèles Qwen3 sont accessibles publiquement sous la licence Apache 2.0 pour faciliter la reproductibilité et la recherche communautaire.

Cette approche unifiée permet une commutation dynamique de mode en fonction des requêtes des utilisateurs, tandis que l'expansion du support linguistique améliore l'accessibilité mondiale grâce à une meilleure compréhension interlinguale.