Multimodal
media MarkTechPost · il y a 3 j · 18 vues

L'équipe Qwen d'Alibaba publie Qwen3.8-LiveTranslate avec une architecture Interleave

L'équipe Qwen d'Alibaba a publié Qwen3.8-LiveTranslate, un modèle d'interprétation simultanée en temps réel de nouvelle génération qui écoute la parole en direct et renvoie du texte et de l'audio traduits pendant que l'orateur parle encore. Cette publication introduit une nouvelle architecture Interleave conçue pour réduire la latence et améliorer la qualité de la traduction.

media MarkTechPost · il y a 5 j · 24 vues

Alibaba Qwen publie Qwen3.8-Omni-Flash, un modèle omni-modal agentic avec une fenêtre de contexte de 1M

L'équipe Qwen d'Alibaba a publié Qwen3.8-Omni-Flash, son premier modèle omni-modal conçu autour de capacités agentic pour la compréhension audio-vidéo et l'utilisation d'outils. Le modèle accepte des entrées textuelles, images, audio et vidéo pour retourner des sorties textuelles, avec une fenêtre de contexte de 1M tokens et un appel de fonction natif.

lab Tencent Hunyuan (HF) · il y a 6 j · 64 vues

Tencent lance WeVisDoc-4B, un analyseur de documents de bout en bout

Tencent a lancé WeVisDoc-4B, un analyseur de documents de bout en bout pour les images de pages qui convertit les pages en Markdown structuré avec des formules LaTeX et des tableaux HTML. Fine-tuné à partir de Qwen3-VL-4B-Instruct, le modèle atteint un score global de 95,38 sur OmniDocBench v1.6 et se classe premier parmi les analyseurs comparés dans les quatre configurations rapportées.

media r/LocalLLaMA · il y a 10 j · 20 vues

InternLM publie le modèle multimodal Intern-S2-397B pour l'intelligence scientifique

InternLM a présenté Intern-S2-397B, un modèle fondamental multimodal de 397 milliards de paramètres conçu pour l'intelligence scientifique et les agents à long terme. Le modèle s'étend sur le pré-entraînement, la couverture des tâches d'apprentissage par renforcement et les environnements d'agents interactifs afin d'améliorer le raisonnement général et les capacités agentic.

lab IBM Research (Granite) · il y a 13 j · 24 vues

IBM et NASA ouvrent le modèle de base lunaire NASA-IBM Lunar Foundation Model en open source

IBM et NASA ont ouvert en open source le modèle de base lunaire NASA-IBM Lunar Foundation Model, un système d'IA qui consolide des décennies de données lunaires multimodales provenant de missions américaines et japonaises en une seule représentation. Construit sur l'architecture TerraMind d'IBM, le modèle intègre des observations à différentes échelles et angles de vue pour relever des défis tels que l'éclairage complexe et la résolution des données.

lab DeepSeek API Docs · il y a 13 j Codeforces (Elo) · 3471.0Elo · 51 vues

DeepSeek lance le modèle V4.1-Flash avec support multimodal natif

DeepSeek a officiellement lancé le modèle DeepSeek-V4.1-Flash, qui est le plus petit membre de sa nouvelle famille d'architectures et présente une compréhension visuelle multimodale native. Cette nouvelle architecture est conçue pour offrir un plafond de capacité plus élevé, des vitesses d'inférence plus rapides, un débit supérieur et un meilleur potentiel de mise à l'échelle pour les modèles plus grands.

media MarkTechPost · il y a 18 j · 33 vues

Google lance la compréhension vidéo agentic pour les modèles Gemini Flash

Google a déployé la compréhension vidéo agentic sur ses modèles Gemini Flash, remplaçant l'ancienne méthode de traitement statique par un système qui navigue dans les chronologies vidéo à la demande. Ce changement permet au modèle de décider quoi regarder, à quel taux d'images et via quelle modalité, plutôt que d'ingérer l'intégralité de la chronologie à un taux fixe d'une image par seconde.

arxiv arXiv cs.CL · il y a 19 j · 36 vues

VisCAD lance une suite de modèles de base avec une intelligence CAD industrielle multimodale

Les chercheurs présentent VisCAD, une suite de modèles de base conçue pour offrir une généralisation étendue et des capacités solides pour la conception réaliste de produits industriels. La suite répond aux défis de la génération au niveau des pièces à partir d'entrées diverses telles que des rendus et du texte, ainsi qu'à la génération au niveau de l'assemblage impliquant des pièces en interaction.

lab Hugging Face Blog · il y a 20 j · 34 vues

NeoMME publie des encodeurs multimodaux efficaces avec recherche à interaction dense et tardive

Les chercheurs présentent NeoMME, une famille d'encodeurs multimodaux multilingues de 260M et 800M paramètres qui traitent le texte et les patches d'image bruts à l'aide d'un seul Transformer bidirectionnel. Contrairement aux modèles de langage visuel génératifs, NeoMME ne repose pas sur des tours de vision pré-entraînés séparés ou des décodeurs causaux ; il est entraîné entièrement从零 avec un objectif de diffusion discrète masquée.