Alibaba annonce Qwen 4 lors de la Conférence Apsara
Alibaba a officiellement annoncé le lancement de Qwen 4 pendant la Conférence Apsara.
Alibaba a officiellement annoncé le lancement de Qwen 4 pendant la Conférence Apsara.
L'équipe Qwen d'Alibaba a publié Qwen3.8-Omni-Flash, son premier modèle omni-modal conçu autour de capacités agentic pour la compréhension audio-vidéo et l'utilisation d'outils. Le modèle accepte des entrées textuelles, images, audio et vidéo pour retourner des sorties textuelles, avec une fenêtre de contexte de 1M tokens et un appel de fonction natif.
L'équipe Qwen d'Alibaba a publié Qwen-Audio-3.1, une pile audio composée de cinq modèles incluant le nouveau Qwen-Audio-3.1-Realtime-plus, un modèle de parole plein duplex conçu pour les agents vocaux capables de raisonnement et d'utilisation d'outils. La publication introduit également des réductions de prix allant jusqu'à 95 % sur les services ASR.
Le laboratoire Deep Algorithms and Systems d'ISTA a publié des versions quantifiées au format GGUF du modèle sparse mixture-of-experts Qwen3.8-Flash-Next, ainsi qu'une build expérimentale ciblée sur les capacités avec la moitié de ses experts supprimés.
Les auteurs présentent RareDx, un système qui couple l'utilisation contrôlée des preuves avec une optimisation de politique ancrée sur un graphe de connaissances afin de résoudre le problème de raisonnement à longue traîne du diagnostic des maladies rares. Le pipeline d'entraînement combine le post-entraînement Top-10 avec RareDx-KGPO, qui projette les prédictions dans un graphe canonique de maladies et intègre la pertinence graduée curatée, la proximité ontologique, la similarité biomédicale et la cohérence phénotypique.
Les chercheurs présentent Visual Answerability Diagnosis with Rationales (VAD-R), un nouveau benchmark conçu pour évaluer la capacité des modèles vision-langage à s'abstenir de répondre aux questions sans réponse, sans se fier à des indices de raccourci. L'étude révèle que si les états cachés peuvent distinguer l'accessibilité de la réponse, les modèles actuels échuent à traduire cela en décisions explicites.
VHD-Play est un pipeline qui génère des environnements d'apprentissage par renforcement agents diversifiés en échantillonnant et résolvant des modèles mathématiques avant de rendre leurs processus décisionnels sous forme d'outils avec état. Cette approche garantit que les dynamiques exécutables et les références de score de trajectoire sont héritées directement du modèle résolu, adressant les problèmes de désalignement courants dans les pipelines de génération existants.
Les chercheurs présentent SkillGym, un cadre qui transforme les compétences d'agents écrites par des humains en environnements d'entraînement exécutables et vérifiables pour des agents à grands modèles de langage. Le système utilise un pipeline compétence-tâche pour instancier des tâches concrètes et vérifier les résultats avec des contrôleurs basés sur du code.
Les chercheurs présentent VideoX-Qwen, un cadre intégré combinant la construction évolutive de données avec l'entraînement du modèle pour faire progresser l'édition vidéo générale et pilotée par des instructions. Le système utilise un pipeline de production qui organise des modèles spécialisés pour générer des enregistrements d'édition directionnelle, résultant en plus de 1,2 million d'échantillons de haute qualité dans les tâches d'ajout, de suppression, de remplacement et d'attributs.
Alibaba Cloud a présenté Qwen3.8-Omni-Flash, un modèle agentique multimodal natif conçu pour les tâches de productivité du monde réel qui améliore substantiellement la compréhension et le raisonnement multimodaux par rapport aux modèles omni précédents.
Alibaba a annoncé des plans pour développer un modèle d'intelligence artificielle contenant entre 5 et 10 billions de paramètres. Parallèlement à cette feuille de route, l'entreprise a également dévoilé une nouvelle puce personnalisée conçue pour soutenir ses besoins en infrastructure.
L'équipe Qwen d'Alibaba a publié Qwen-Image-2.1, un modèle unifié de génération d'images à partir de texte et d'édition d'images qui consolide les précédents points de contrôle séparés en un seul transformateur de diffusion de 7B paramètres.
Qwen a publié Qwen-Image-2.1, un modèle unifié conçu à la fois pour la génération et l'édition d'images.
L'équipe Qwen d'Alibaba a publié Qwen3.8-LiveTranslate, un modèle d'interprétation simultanée en temps réel de nouvelle génération qui écoute la parole en direct et renvoie du texte et de l'audio traduits pendant que l'orateur parle encore. Cette publication introduit une nouvelle architecture Interleave conçue pour réduire la latence et améliorer la qualité de la traduction.
Alibaba a publié un modèle d'intelligence artificielle médicale open-source capable de détecter le cancer et environ 150 autres affections médicales.
Le modèle Qwen3.8 Max (0902) a obtenu un score de 45 à l'Indice d'Intelligence d'Artificial Analysis, récupérant la première place du classement chinois.
TRL v1.14 introduit le support de LoRA pour l'AsyncGRPOTrainer, lui permettant d'entraîner un adaptateur Low-Rank Adaptation et de synchroniser uniquement ce petit fichier avec les workers d'inférence vLLM. Cette architecture découple les tâches d'entraînement et de génération sur des machines séparées en utilisant un Storage Bucket partagé comme pont de système de fichiers, éliminant ainsi le besoin de NCCL ou de communication réseau directe entre les nœuds.
Une étude caractérise les « FragileTokens », entrées de vocabulaire dans les modèles de langage à poids ouverts qui copient avec succès lorsqu'ils sont isolés mais présentent des erreurs lorsqu'ils sont intégrés dans un texte environnant. La recherche souligne que la préservation littérale de l'identité n'est pas garantie par les tests d'isolation standards, car les tokens peuvent être supprimés, substitués ou tronqués au sein de séquences.
ExecCritic introduit un cadre qui sépare la construction des tests de la réparation du code source afin d'éviter une confiance excessive dans les agents de codage. Le système emploie un agent Test et un agent Repair, tous deux alimentés par Qwen-3.5-35B-A3B, entraînés séparément à l'aide de l'apprentissage par renforcement.
Les chercheurs présentent ExecCritic, un cadre qui combine un échafaudage de vérification-révision de tests avec un apprentissage par renforcement spécifique au rôle pour améliorer les agents de codage. Le système sépare la construction des tests de la réparation du code source, en utilisant un agent Test pour générer des tests natifs au dépôt et un agent Repair pour réviser le code sur la base des retours d'exécution.