Tema · Multimodal
lab NVIDIA Research · hace 13 d · 8 vistas

NVIDIA presenta Spatial-IQ, un marco de diagnóstico jerárquico para el razonamiento espacial en modelos multimodales

Investigadores de NVIDIA han presentado Spatial-IQ, un marco de diagnóstico diseñado para descomponer la inteligencia espacial de los grandes modelos de lenguaje multimodales (MLLMs). A diferencia de las evaluaciones existentes que tratan a los modelos como cajas negras, este enfoque descompone el conteo de objetos en estructuras 3D apiladas en nueve sub-tareas perceptivas y cognitivas alineadas con las etapas del desarrollo humano.

lab Google — The Keyword (AI) · hace 18 d

Google amplía la automatización de tareas con Gemini Intelligence y lleva Notebook a dispositivos Galaxy

En Galaxy Unpacked 2026, Google anunció tres actualizaciones para los nuevos Samsung Galaxy Z Fold8 Ultra, Fold8 y Flip8, centradas en el despliegue de Gemini Intelligence. La empresa está ampliando sus capacidades de automatización de tareas para admitir más de 40 aplicaciones populares e introduciendo la aplicación Gemini Notebook directamente en estos dispositivos.

lab NVIDIA Research · hace 26 d

Estudio de RV encuentra que pacientes con IVT tienen detección de colisiones más lenta y mayores márgenes de seguridad

Los investigadores desarrollaron una tarea inmersiva de realidad virtual para evaluar la detección y evitación de colisiones peatonales en individuos con impedimento visual cerebral (IVT) en comparación con participantes de control. El estudio rastreó la mirada ocular, respuestas locomotoras y conductuales mientras los sujetos caminaban por un centro comercial simulado poblado con multitudes de diversas densidades.

lab Mistral AI News · hace 5 d · 3 vistas

Shieldstral presenta un clasificador de seguridad multimodal de 3B adaptable a políticas

Shieldstral es un clasificador de seguridad multimodal de pesos abiertos de 3B que enmarca la moderación de contenido como una tarea de respuesta a preguntas adaptable a políticas, lo que le permite aceptar políticas en lenguaje natural durante la inferencia sin necesidad de reentrenamiento. Unifica la evaluación de seguridad de texto e imágenes y proporciona puntuaciones de seguridad calibradas en diversos benchmarks mientras se ejecuta de manera eficiente en una única GPU NVIDIA de 16GB.

lab Tencent Hunyuan (HF) · hace 26 d · 2 vistas

Tencent lanza Hy-Embodied-VLM-1.0, modelo base eficiente de visión y lenguaje para agentes encarnados

Tencent ha lanzado Hy-Embodied-VLM-1.0, un modelo base eficiente de visión y lenguaje basado en Mixture-of-Experts diseñado para agentes encarnados que operan en el mundo físico. El modelo activa solo aproximadamente 3 mil millones de parámetros por token de un total de 30 mil millones, con el objetivo de equilibrar una alta eficiencia de inferencia con una sólida comprensión del mundo físico.

media MarkTechPost · hace 5 d · 2 vistas

NVIDIA lanza Alpamayo 2 Super, un modelo VLA abierto de 34B para conducción autónoma

NVIDIA ha lanzado Alpamayo 2 Super, un modelo de visión-lenguaje-acción (VLA) de 34 mil millones de parámetros diseñado para robotaxis y conducción autónoma bajo la licencia OpenMDW-1.1. El modelo aborda eventos de cola larga combinando una base Cosmos 3 Super Reasoner de 32B con un decodificador de acciones basado en difusión de 2.3B para generar trayectorias, explicaciones causales y meta-acciones a partir de video multicámara.

arxiv arXiv cs.AI · hace 5 d

Video-DeepResearch presenta un agente multimodal para flujos de video continuos

Los investigadores presentan Video-DeepResearch (Video-DR), un marco que extiende los agentes multimodales desde imágenes estáticas a flujos de video continuos, abordando el sesgo de modalidad y la fuga de conocimiento paramétrico. El sistema emplea una pipeline de percepción-exploración desacoplada con desbloqueo progresivo de herramientas para garantizar la fundamentación visual entre fotogramas antes de la recuperación web.

media MarkTechPost · hace 7 d GPQA Diamond · 89.5% · 1 vista

Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B

Thinking Machines Lab ha lanzado Inkling-Small, un modelo Mixture-of-Experts de pesos abiertos con 276 mil millones de parámetros totales y 12 mil millones de parámetros activos. El modelo está entrenado para razonar nativamente sobre texto, imágenes y audio, cuenta con una ventana de contexto de 1M tokens y esfuerzo de pensamiento ajustable.