Sujet · Multimodal
lab DeepSeek API Docs · il y a 21 j Codeforces (Elo) · 3471.0Elo · 67 vues

DeepSeek lance le modèle V4.1-Flash avec support multimodal natif

DeepSeek a officiellement lancé le modèle DeepSeek-V4.1-Flash, qui est le plus petit membre de sa nouvelle famille d'architectures et présente une compréhension visuelle multimodale native. Cette nouvelle architecture est conçue pour offrir un plafond de capacité plus élevé, des vitesses d'inférence plus rapides, un débit supérieur et un meilleur potentiel de mise à l'échelle pour les modèles plus grands.

lab Microsoft Research Blog · il y a 23 h · 3 vues

Microsoft Research présente Quine, un système d'IA pour la recherche biologique multimodale

Microsoft Research a présenté Quine, un nouvel effort de recherche conçu pour créer un modèle du monde multimodal de la biologie et un harnais interactif qui relie les modèles, les outils scientifiques, la littérature et les chercheurs. Le système vise à combler le fossé entre la modélisation computationnelle et l'expérimentation réelle en permettant aux scientifiques de générer des propositions testées dans des environnements de laboratoire humide, avec des résultats qui alimentent un retour pour affiner les questions futures.

media MarkTechPost · il y a 12 j · 35 vues

Alibaba Qwen publie Qwen3.8-Omni-Flash, un modèle omni-modal agentic avec une fenêtre de contexte de 1M

L'équipe Qwen d'Alibaba a publié Qwen3.8-Omni-Flash, son premier modèle omni-modal conçu autour de capacités agentic pour la compréhension audio-vidéo et l'utilisation d'outils. Le modèle accepte des entrées textuelles, images, audio et vidéo pour retourner des sorties textuelles, avec une fenêtre de contexte de 1M tokens et un appel de fonction natif.

lab Hugging Face Blog · il y a 6 j · 13 vues

Liquid AI publie LFM2.5-VL-DSpark pour accélérer l'inférence des modèles vision-langage

Liquid AI a publié le modèle brouillon LFM2.5-VL-DSpark, un drafter de décodage spéculatif conçu pour accélérer l'inférence du modèle vision-langage LFM2.5-VL-3B. Le drafter capture les états cachés des couches fixes du modèle cible pour générer des tokens candidats, n'ajoutant que 280M de paramètres (surcharge de 8,9 %) tout en maintenant une dimensionalité identique entre les modalités.

media MarkTechPost · il y a 10 j · 28 vues

L'équipe Qwen d'Alibaba publie Qwen3.8-LiveTranslate avec une architecture Interleave

L'équipe Qwen d'Alibaba a publié Qwen3.8-LiveTranslate, un modèle d'interprétation simultanée en temps réel de nouvelle génération qui écoute la parole en direct et renvoie du texte et de l'audio traduits pendant que l'orateur parle encore. Cette publication introduit une nouvelle architecture Interleave conçue pour réduire la latence et améliorer la qualité de la traduction.

lab Tencent Hunyuan (HF) · il y a 13 j · 78 vues

Tencent lance WeVisDoc-4B, un analyseur de documents de bout en bout

Tencent a lancé WeVisDoc-4B, un analyseur de documents de bout en bout pour les images de pages qui convertit les pages en Markdown structuré avec des formules LaTeX et des tableaux HTML. Fine-tuné à partir de Qwen3-VL-4B-Instruct, le modèle atteint un score global de 95,38 sur OmniDocBench v1.6 et se classe premier parmi les analyseurs comparés dans les quatre configurations rapportées.

media r/LocalLLaMA · il y a 17 j · 25 vues

InternLM publie le modèle multimodal Intern-S2-397B pour l'intelligence scientifique

InternLM a présenté Intern-S2-397B, un modèle fondamental multimodal de 397 milliards de paramètres conçu pour l'intelligence scientifique et les agents à long terme. Le modèle s'étend sur le pré-entraînement, la couverture des tâches d'apprentissage par renforcement et les environnements d'agents interactifs afin d'améliorer le raisonnement général et les capacités agentic.

lab IBM Research (Granite) · il y a 20 j · 25 vues

IBM et NASA ouvrent le modèle de base lunaire NASA-IBM Lunar Foundation Model en open source

IBM et NASA ont ouvert en open source le modèle de base lunaire NASA-IBM Lunar Foundation Model, un système d'IA qui consolide des décennies de données lunaires multimodales provenant de missions américaines et japonaises en une seule représentation. Construit sur l'architecture TerraMind d'IBM, le modèle intègre des observations à différentes échelles et angles de vue pour relever des défis tels que l'éclairage complexe et la résolution des données.