Sujet · Multimodal
lab Google DeepMind Blog · il y a 2 j · 13 vues

Google DeepMind publie le modèle SL2T de traduction de langue des signes en texte pour Gboard et Live Transcribe

Google DeepMind et Android ont présenté SL2T, un modèle de traduction de langue des signes en texte (SL2T) massivement multilingue qui apporte l'IA de la langue des signes aux produits grand public pour la première fois. La technologie alimente la dictée de signes en texte dans Gboard et Live Transcribe sur Pixel 11, en commençant par la langue des signes américaine (ASL) vers l'anglais.

lab Google — The Keyword (AI) · il y a 3 j · 40 vues

Google démontre des capacités de consultation vidéo clinique en temps réel avec AMIE

Google Research et Google DeepMind ont fait progresser leur système de recherche en IA médicale, AMIE, pour démontrer des capacités de consultation vidéo clinique en temps réel dans une étude inédite. Construit sur Gemini et Project Astra à l'aide d'une architecture multi-agents, le système interprète les indices visuels et auditifs, guide les examens physiques virtuels et raisonne diagnostiquement en temps réel.

lab Microsoft Research Blog · il y a 3 j · 11 vues

Microsoft Research présente CARE-X, un VLM unifié de radiographie thoracique avec supervision auxiliaire et mesure augmentée par outils

Microsoft Research a présenté CARE-X, un modèle de recherche conçu pour combler les lacunes des modèles vision-langage actuels en radiologie en associant la génération de rapports génératifs à des prédictions diagnostiques calibrées. Le système utilise l'apprentissage par renforcement (DAPO) pour récompenser l'exactitude clinique et associe le modèle Qwen3-VL-4B-Instruct à des outils de mesure déterministes afin d'évaluer les performances sur des pathologies nécessitant des calculs précis.

lab NVIDIA Research · il y a 4 j · 3 vues

GenRecal distille de grands modèles vision-langage en petits par recalibration

Les chercheurs présentent GenRecal, un framework de distillation à usage général qui transfère des connaissances de grands modèles vision-langage (VLM) vers des contreparties plus petites et plus efficaces. La méthode aborde le défi des architectures VLM hétérogènes en utilisant un Recalibrator pour aligner et adapter les représentations de caractéristiques entre différents types de modèles.

lab NVIDIA Research · il y a 4 j

Hide to See introduit le masquage du préfixe de raisonnement pour la distillation VLM

Les chercheurs proposent un nouveau cadre de distillation penser-réponse qui améliore la capacité des modèles visuo-linguistiques compacts à utiliser des preuves visuelles en masquant les préfixes de raisonnement saillants. Cette approche aborde le problème de l'"oubli visuel" courant dans les traces longues de penser-réponse, où les étudiants perdent le focus sur les indices visuels pendant le raisonnement étendu.

lab NVIDIA Research · il y a 18 j · 9 vues

NVIDIA présente Spatial-IQ, un cadre de diagnostic hiérarchique pour le raisonnement spatial des modèles multimodaux

Les chercheurs de NVIDIA ont présenté Spatial-IQ, un cadre de diagnostic conçu pour décomposer l'intelligence spatiale des grands modèles de langage multimodaux (MLLM). Contrairement aux benchmarks existants qui traitent les modèles comme des boîtes noires, cette approche décompose le comptage d'objets dans des structures 3D empilées en neuf sous-tâches perceptives et cognitives alignées sur les étapes du développement humain.

lab Google — The Keyword (AI) · il y a 23 j · 1 vue

Google élargit l'automatisation des tâches avec Gemini Intelligence et amène Notebook sur les appareils Galaxy

Lors de Galaxy Unpacked 2026, Google a annoncé trois mises à jour pour les nouveaux Samsung Galaxy Z Fold8 Ultra, Fold8 et Flip8, centrées sur le déploiement de Gemini Intelligence. L'entreprise élargit ses capacités d'automatisation des tâches pour prendre en charge plus de 40 applications populaires et introduit l'application Gemini Notebook directement sur ces appareils.

lab Mistral AI News · il y a 10 j · 4 vues

Shieldstral présente un classificateur de sécurité multimodal 3B adaptatif aux politiques

Shieldstral est un classificateur de sécurité multimodal à poids ouverts de 3B paramètres qui formule la modération de contenu comme une tâche de réponse aux questions adaptative aux politiques, lui permettant d'accepter des politiques en langage naturel lors de l'inférence sans réentraînement. Il unifie l'évaluation de la sécurité du texte et de l'image et fournit des scores de sécurité calibrés sur divers benchmarks tout en s'exécutant efficacement sur une seule GPU NVIDIA 16 Go.

arxiv arXiv cs.LG · il y a 18 h · 2 vues

Intern-S2-Preview : Modèle fondamental agentic scientifique

Les auteurs présentent Intern-S2-Preview, une série de modèles fondamentaux agentic scientifiques conçus pour soutenir la compréhension multimodale scientifique, le raisonnement, la génération et les tâches à long terme. Le pipeline d'entraînement commence par un pré-entraînement multimodal scientifique sur des documents scientifiques rendus, des données image-texte entrelacées et divers corpus scientifiques.

media MarkTechPost · il y a 1 j IFEval · 82.3% · 1 vue

Liquid AI publie LFM2.5-VL-3B, un modèle vision-langue de 3 milliards de paramètres pour le déploiement sur appareil avec appels d'outils

Liquid AI a publié LFM2.5-VL-3B, un modèle vision-langue de 3,1 milliards de paramètres conçu pour un déploiement efficace sur appareil. Le modèle lit des écrans numériques dans les environnements mobiles, web et de bureau, ancre les objets à des coordonnées, analyse des documents et exécute des appels d'outils à partir d'entrées textuelles ou image.

arxiv arXiv cs.AI · il y a 2 j · 3 vues

SCOUT améliore le raisonnement spatial des VLM via un CoT structuré et un RL supervisé par processus

Les chercheurs proposent SCOUT, un cadre qui améliore le raisonnement spatial des Modèles Vision-Language en combinant une Chaîne de Pensée structurée avec un apprentissage par renforcement à récompense de processus multi-objectif. Cette approche traite les problèmes d'attribution de crédit dans les méthodes RL existantes et intègre la perception de la profondeur pour une compréhension 3D complète.

lab Hugging Face Blog · il y a 2 j · 14 vues

Liquid AI publie LFM2.5-VL-3B pour des capacités de vision sur périphérique plus rapides

Liquid AI a publié LFM2.5-VL-3B, un modèle de vision et de langage de 3 milliards de paramètres conçu pour offrir des performances améliorées et plus rapides sur les appareils en périphérie. Le modèle associe un encodeur de vision SigLIP2 400M NaFlex à la structure principale de sa contrepartie uniquement textuelle, entraîné sur environ 34 billions de tokens, incluant quatre fois plus de données visuelles que les précédentes versions.

lab Liquid AI · il y a 2 j Berkeley Function-Calling Leaderboard · 32.5% · 15 vues

LFM2.5-VL-3B améliore la compréhension d'écran et l'appel de fonctions pour le déploiement en périphérie

LFM2.5-VL-3B est un nouveau modèle vision-langue qui offre des performances compétitives face à des modèles plus grands tout en maintenant une faible latence pour les applications temps réel et sur appareil. Il s'appuie sur la précédente version LFM2-VL-3B avec des améliorations significatives dans la compréhension d'écran, l'ancrage (grounding), l'appel de fonctions et les capacités d'entrée multi-images.

arxiv arXiv cs.AI · il y a 4 j

AMIE (Video) atteint des performances de niveau expert dans les consultations médicales en temps réel

Les chercheurs ont démontré le premier système d'IA de niveau expert pour les consultations vidéo cliniques en temps réel utilisant AMIE (Video), un système multi-agents basé sur Gemini qui intègre un dialogue à faible latence avec une perception audiovisuelle en temps réel. Dans une étude randomisée d'examen clinique structuré objectif impliquant 30 médecins de premier recours et 100 scénarios, les évaluateurs cliniques ont jugé le système égal ou supérieur aux médecins pour la prise d'antécédents, le diagnostic, la prise en charge et l'observation physique.