Laboratoire · Alibaba (Qwen)
media MarkTechPost · il y a 12 j · 35 vues

Alibaba Qwen publie Qwen3.8-Omni-Flash, un modèle omni-modal agentic avec une fenêtre de contexte de 1M

L'équipe Qwen d'Alibaba a publié Qwen3.8-Omni-Flash, son premier modèle omni-modal conçu autour de capacités agentic pour la compréhension audio-vidéo et l'utilisation d'outils. Le modèle accepte des entrées textuelles, images, audio et vidéo pour retourner des sorties textuelles, avec une fenêtre de contexte de 1M tokens et un appel de fonction natif.

arxiv arXiv cs.AI · il y a 2 j · 1 vue

RareDx utilise l'optimisation de politique ancrée sur un graphe pour améliorer le diagnostic des maladies rares

Les auteurs présentent RareDx, un système qui couple l'utilisation contrôlée des preuves avec une optimisation de politique ancrée sur un graphe de connaissances afin de résoudre le problème de raisonnement à longue traîne du diagnostic des maladies rares. Le pipeline d'entraînement combine le post-entraînement Top-10 avec RareDx-KGPO, qui projette les prédictions dans un graphe canonique de maladies et intègre la pertinence graduée curatée, la proximité ontologique, la similarité biomédicale et la cohérence phénotypique.

arxiv arXiv cs.CL · il y a 2 j · 1 vue

Rep2Act aligne les représentations des VLM pour améliorer l'abstention sur le nouveau benchmark VAD-R

Les chercheurs présentent Visual Answerability Diagnosis with Rationales (VAD-R), un nouveau benchmark conçu pour évaluer la capacité des modèles vision-langage à s'abstenir de répondre aux questions sans réponse, sans se fier à des indices de raccourci. L'étude révèle que si les états cachés peuvent distinguer l'accessibilité de la réponse, les modèles actuels échuent à traduire cela en décisions explicites.

arxiv arXiv cs.CL · il y a 7 j · 8 vues

VHD-Play génère des environnements RL agents à partir de mécanismes résolus

VHD-Play est un pipeline qui génère des environnements d'apprentissage par renforcement agents diversifiés en échantillonnant et résolvant des modèles mathématiques avant de rendre leurs processus décisionnels sous forme d'outils avec état. Cette approche garantit que les dynamiques exécutables et les références de score de trajectoire sont héritées directement du modèle résolu, adressant les problèmes de désalignement courants dans les pipelines de génération existants.

arxiv arXiv cs.CL · il y a 7 j SWE-Lancer · 51.47% · 10 vues

SkillGym intègre les compétences humaines dans les LLM pour la résolution de problèmes réels

Les chercheurs présentent SkillGym, un cadre qui transforme les compétences d'agents écrites par des humains en environnements d'entraînement exécutables et vérifiables pour des agents à grands modèles de langage. Le système utilise un pipeline compétence-tâche pour instancier des tâches concrètes et vérifier les résultats avec des contrôleurs basés sur du code.

arxiv arXiv cs.AI · il y a 8 j · 17 vues

VideoX-Qwen présente un cadre centré sur les données pour l'édition vidéo basée sur des instructions

Les chercheurs présentent VideoX-Qwen, un cadre intégré combinant la construction évolutive de données avec l'entraînement du modèle pour faire progresser l'édition vidéo générale et pilotée par des instructions. Le système utilise un pipeline de production qui organise des modèles spécialisés pour générer des enregistrements d'édition directionnelle, résultant en plus de 1,2 million d'échantillons de haute qualité dans les tâches d'ajout, de suppression, de remplacement et d'attributs.

media MarkTechPost · il y a 10 j · 28 vues

L'équipe Qwen d'Alibaba publie Qwen3.8-LiveTranslate avec une architecture Interleave

L'équipe Qwen d'Alibaba a publié Qwen3.8-LiveTranslate, un modèle d'interprétation simultanée en temps réel de nouvelle génération qui écoute la parole en direct et renvoie du texte et de l'audio traduits pendant que l'orateur parle encore. Cette publication introduit une nouvelle architecture Interleave conçue pour réduire la latence et améliorer la qualité de la traduction.

lab Hugging Face Blog · il y a 16 j · 19 vues

TRL v1.14 AsyncGRPOTrainer permet la synchronisation uniquement LoRA sur les Jobs Hugging Face

TRL v1.14 introduit le support de LoRA pour l'AsyncGRPOTrainer, lui permettant d'entraîner un adaptateur Low-Rank Adaptation et de synchroniser uniquement ce petit fichier avec les workers d'inférence vLLM. Cette architecture découple les tâches d'entraînement et de génération sur des machines séparées en utilisant un Storage Bucket partagé comme pont de système de fichiers, éliminant ainsi le besoin de NCCL ou de communication réseau directe entre les nœuds.

media Hugging Face Forums · il y a 17 j · 29 vues

Une étude identifie des FragileTokens qui échouent à la copie contextuelle malgré le passage des tests d'isolation

Une étude caractérise les « FragileTokens », entrées de vocabulaire dans les modèles de langage à poids ouverts qui copient avec succès lorsqu'ils sont isolés mais présentent des erreurs lorsqu'ils sont intégrés dans un texte environnant. La recherche souligne que la préservation littérale de l'identité n'est pas garantie par les tests d'isolation standards, car les tokens peuvent être supprimés, substitués ou tronqués au sein de séquences.

arxiv arXiv cs.AI · il y a 22 j SWE-bench Verified · 72.6% · 31 vues

ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via la réparation guidée par tests

ExecCritic introduit un cadre qui sépare la construction des tests de la réparation du code source afin d'éviter une confiance excessive dans les agents de codage. Le système emploie un agent Test et un agent Repair, tous deux alimentés par Qwen-3.5-35B-A3B, entraînés séparément à l'aide de l'apprentissage par renforcement.

arxiv arXiv cs.CL · il y a 22 j SWE-bench Verified · 72.6% · 32 vues

ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via une réparation guidée par des tests

Les chercheurs présentent ExecCritic, un cadre qui combine un échafaudage de vérification-révision de tests avec un apprentissage par renforcement spécifique au rôle pour améliorer les agents de codage. Le système sépare la construction des tests de la réparation du code source, en utilisant un agent Test pour générer des tests natifs au dépôt et un agent Repair pour réviser le code sur la base des retours d'exécution.