Multimodal
media MarkTechPost · hace 4 d · 1 vista

NVIDIA lanza Alpamayo 2 Super, un modelo VLA abierto de 34B para conducción autónoma

NVIDIA ha lanzado Alpamayo 2 Super, un modelo de visión-lenguaje-acción (VLA) de 34 mil millones de parámetros diseñado para robotaxis y conducción autónoma bajo la licencia OpenMDW-1.1. El modelo aborda eventos de cola larga combinando una base Cosmos 3 Super Reasoner de 32B con un decodificador de acciones basado en difusión de 2.3B para generar trayectorias, explicaciones causales y meta-acciones a partir de video multicámara.

arxiv arXiv cs.AI · hace 4 d

Video-DeepResearch presenta un agente multimodal para flujos de video continuos

Los investigadores presentan Video-DeepResearch (Video-DR), un marco que extiende los agentes multimodales desde imágenes estáticas a flujos de video continuos, abordando el sesgo de modalidad y la fuga de conocimiento paramétrico. El sistema emplea una pipeline de percepción-exploración desacoplada con desbloqueo progresivo de herramientas para garantizar la fundamentación visual entre fotogramas antes de la recuperación web.

lab Mistral AI News · hace 5 d · 3 vistas

Shieldstral presenta un clasificador de seguridad multimodal de 3B adaptable a políticas

Shieldstral es un clasificador de seguridad multimodal de pesos abiertos de 3B que enmarca la moderación de contenido como una tarea de respuesta a preguntas adaptable a políticas, lo que le permite aceptar políticas en lenguaje natural durante la inferencia sin necesidad de reentrenamiento. Unifica la evaluación de seguridad de texto e imágenes y proporciona puntuaciones de seguridad calibradas en diversos benchmarks mientras se ejecuta de manera eficiente en una única GPU NVIDIA de 16GB.

media MarkTechPost · hace 6 d GPQA Diamond · 89.5% · 1 vista

Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B

Thinking Machines Lab ha lanzado Inkling-Small, un modelo Mixture-of-Experts de pesos abiertos con 276 mil millones de parámetros totales y 12 mil millones de parámetros activos. El modelo está entrenado para razonar nativamente sobre texto, imágenes y audio, cuenta con una ventana de contexto de 1M tokens y esfuerzo de pensamiento ajustable.

media r/LocalLLaMA · hace 12 d · 5 vistas

Microsoft lanza Mage-VL, un modelo multimodal de streaming nativo de códec

Microsoft ha lanzado Mage-VL, un modelo base multimodal eficiente de 4B de parámetros para la comprensión de imágenes y video que utiliza un enfoque nativo de códec para optimizar el procesamiento visual. El sistema separa los flujos de video en fotogramas ancla (I) y predichos (P), conservando solo los parches donde el códec asigna bits para reducir el consumo de tokens visuales en más del 75%.

lab NVIDIA Research · hace 12 d · 8 vistas

NVIDIA presenta Spatial-IQ, un marco de diagnóstico jerárquico para el razonamiento espacial en modelos multimodales

Investigadores de NVIDIA han presentado Spatial-IQ, un marco de diagnóstico diseñado para descomponer la inteligencia espacial de los grandes modelos de lenguaje multimodales (MLLMs). A diferencia de las evaluaciones existentes que tratan a los modelos como cajas negras, este enfoque descompone el conteo de objetos en estructuras 3D apiladas en nueve sub-tareas perceptivas y cognitivas alineadas con las etapas del desarrollo humano.

arxiv arXiv cs.AI · hace 12 d · 1 vista

ClinFusion presenta un MLLM centrado en la visión para una comprensión médica integral

Los investigadores presentan ClinFusion, un modelo de lenguaje grande multimodal centrado en la visión diseñado para abordar los desafíos de implementar IA en la práctica clínica al unificar la comprensión de imágenes médicas 2D y 3D. El sistema cuenta con un codificador visual en cascada composicional con un operador de fusión de localidad espacialmente consciente en cascada e incluye un nuevo marco de evaluación que comprende MedIF-Bench y métricas basadas en la región de interés.

arxiv arXiv cs.CL · hace 12 d · 1 vista

ClinFusion: un MLLM centrado en la visión establece un nuevo estado del arte en benchmarks médicos

Los investigadores presentan ClinFusion, un modelo de lenguaje grande multimodal centrado en la visión diseñado para una comprensión médica holística que unifica el análisis de imágenes 2D y nativo 3D. El sistema utiliza un codificador visual en cascada composicional con un operador de fusión de localidad espacialmente consciente en cascada para abordar los desafíos de la imagen médica heterogénea.

media MarkTechPost · hace 14 d · 2 vistas

Induction Labs lanza Photon-1, un modelo de imaginación entrenado con 18 años de video

Induction Labs ha lanzado Photon-1, un transformador de mezcla de expertos disperso de 106B-A5B que aprende a simular entornos de escritorio y jugar videojuegos prediciendo fotogramas futuros a partir de video sin etiquetas de acción. El modelo utiliza cuantización escalar finita para comprimir cada fotograma en 960 tokens discretos, logrando una compresión más de 100 veces mejor que las representaciones existentes mientras preserva los detalles de texto y diseño.