Multimodal
media MarkTechPost · il y a 4 j · 1 vue

NVIDIA publie Alpamayo 2 Super, un modèle VLA ouvert de 34 milliards de paramètres pour la conduite autonome

NVIDIA a publié Alpamayo 2 Super, un modèle vision-langage-action (VLA) de 34 milliards de paramètres conçu pour les robotaxis et la conduite autonome sous la licence OpenMDW-1.1. Le modèle cible les événements à longue traîne en combinant une colonne vertébrale Cosmos 3 Super Reasoner de 32 milliards de paramètres avec un décodeur d'actions basé sur la diffusion de 2,3 milliards de paramètres pour générer des trajectoires, des explications causales et des méta-actions à partir de vidéos multi-caméras.

arxiv arXiv cs.AI · il y a 4 j

Video-DeepResearch présente un agent multimodal pour les flux vidéo continus

Les chercheurs présentent Video-DeepResearch (Video-DR), un cadre étendant les agents multimodaux des images statiques aux flux vidéo continus, en s'attaquant au biais de modalité et à la fuite de connaissances paramétriques. Le système utilise un pipeline de perception-exploration découplé avec un déverrouillage progressif des outils pour imposer l'ancrage visuel inter-images avant la récupération web.

lab Mistral AI News · il y a 5 j · 3 vues

Shieldstral présente un classificateur de sécurité multimodal 3B adaptatif aux politiques

Shieldstral est un classificateur de sécurité multimodal à poids ouverts de 3B paramètres qui formule la modération de contenu comme une tâche de réponse aux questions adaptative aux politiques, lui permettant d'accepter des politiques en langage naturel lors de l'inférence sans réentraînement. Il unifie l'évaluation de la sécurité du texte et de l'image et fournit des scores de sécurité calibrés sur divers benchmarks tout en s'exécutant efficacement sur une seule GPU NVIDIA 16 Go.

media MarkTechPost · il y a 6 j GPQA Diamond · 89.5% · 1 vue

Thinking Machines Lab publie Inkling-Small, un modèle MoE multimodal à poids ouverts de 276B

Thinking Machines Lab a publié Inkling-Small, un modèle Mixture-of-Experts à poids ouverts avec 276 milliards de paramètres au total et 12 milliards de paramètres actifs. Le modèle est entraîné pour raisonner nativement sur le texte, les images et l'audio, avec une fenêtre de contexte de 1M de tokens et un effort de réflexion ajustable.

media r/LocalLLaMA · il y a 12 j · 5 vues

Microsoft publie Mage-VL, un modèle multimodal en streaming natif par codec

Microsoft a publié Mage-VL, un modèle de base multimodal efficace de 4 milliards de paramètres pour la compréhension d'images et de vidéos, qui utilise une approche native par codec pour rationaliser le traitement visuel. Le système sépare les flux vidéo en images ancrées (I) et images prédites (P), ne conservant que les patches où le codec alloue des bits afin de réduire la consommation de tokens visuels de plus de 75 %.

lab NVIDIA Research · il y a 12 j · 8 vues

NVIDIA présente Spatial-IQ, un cadre de diagnostic hiérarchique pour le raisonnement spatial des modèles multimodaux

Les chercheurs de NVIDIA ont présenté Spatial-IQ, un cadre de diagnostic conçu pour décomposer l'intelligence spatiale des grands modèles de langage multimodaux (MLLM). Contrairement aux benchmarks existants qui traitent les modèles comme des boîtes noires, cette approche décompose le comptage d'objets dans des structures 3D empilées en neuf sous-tâches perceptives et cognitives alignées sur les étapes du développement humain.

arxiv arXiv cs.AI · il y a 12 j · 1 vue

ClinFusion présente un MLLM centré sur la vision pour une compréhension médicale holistique

Les chercheurs présentent ClinFusion, un grand modèle de langage multimodal centré sur la vision conçu pour relever les défis du déploiement de l'IA dans la pratique clinique en unifiant la compréhension des images médicales 2D et 3D. Le système intègre un encodeur visuel en cascade compositionnel avec un opérateur de fusion de localité spatiale-aware en cascade et comprend un nouveau cadre d'évaluation composé de MedIF-Bench et de métriques ancrées sur la région d'intérêt.

arxiv arXiv cs.CL · il y a 12 j · 1 vue

ClinFusion : un MLLM centré sur la vision établit un nouvel état de l'art sur les benchmarks médicaux

Les chercheurs présentent ClinFusion, un modèle de langage multimodal large centré sur la vision, conçu pour une compréhension médicale holistique qui unifie l'analyse d'images 2D et native 3D. Le système utilise un encodeur visuel en cascade compositionnel avec un opérateur de fusion de localité spatialement conscient en cascade (Cascade Spatial-Aware Locality Fusion) pour relever les défis de l'imagerie médicale hétérogène.

media MarkTechPost · il y a 14 j · 2 vues

Induction Labs publie Photon-1, un modèle d'imagination entraîné sur 18 ans de vidéos

Induction Labs a publié Photon-1, un transformateur à mélange d'experts (MoE) épars de 106B-A5B qui apprend à simuler des environnements de bureau et à jouer à des jeux en prédisant les futures images à partir de vidéos brutes sans étiquettes d'action. Le modèle utilise la quantification scalaire finie pour compresser chaque image en 960 jetons discrets, atteignant une compression plus de 100 fois meilleure que les représentations existantes tout en préservant les détails du texte et de la mise en page.