Multimodal
media MarkTechPost · hace 3 d · 18 vistas

El equipo de Alibaba Qwen lanza Qwen3.8-LiveTranslate con arquitectura Interleave

El equipo de Alibaba Qwen ha lanzado Qwen3.8-LiveTranslate, un modelo de interpretación simultánea en tiempo real de nueva generación que escucha el habla en vivo y devuelve texto y audio traducidos mientras el hablante aún está hablando. El lanzamiento introduce una nueva arquitectura Interleave diseñada para reducir la latencia y mejorar la calidad de la traducción.

media MarkTechPost · hace 5 d · 24 vistas

Alibaba Qwen lanza Qwen3.8-Omni-Flash, un modelo omnimodal agéntico con contexto de 1M

El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Omni-Flash, su primer modelo omnimodal diseñado en torno a capacidades agénticas para la comprensión de audio y video, así como el uso de herramientas. El modelo acepta entradas de texto, imágenes, audio y video para devolver salidas de texto, con una ventana de contexto de 1M de tokens y llamada de funciones nativa.

lab Tencent Hunyuan (HF) · hace 6 d · 64 vistas

Tencent lanza WeVisDoc-4B, un analizador de documentos de extremo a extremo

Tencent ha lanzado WeVisDoc-4B, un analizador de documentos de extremo a extremo para imágenes de páginas que convierte las páginas en Markdown estructurado con fórmulas LaTeX y tablas HTML. Fine-tuneado desde Qwen3-VL-4B-Instruct, el modelo alcanza una puntuación general de 95.38 en OmniDocBench v1.6 y se clasifica primero entre los analizadores comparados en las cuatro configuraciones reportadas.

lab IBM Research (Granite) · hace 13 d · 24 vistas

IBM y NASA liberan el modelo base NASA-IBM Lunar Foundation Model de código abierto

IBM y NASA han liberado como código abierto el modelo base NASA-IBM Lunar Foundation Model, un sistema de IA que consolida décadas de datos lunares multimodales de misiones estadounidenses y japonesas en una única representación. Construido sobre la arquitectura TerraMind de IBM, el modelo integra observaciones a diferentes escalas y ángulos de visión para abordar desafíos como la iluminación compleja y la resolución de datos.

lab DeepSeek API Docs · hace 13 d Codeforces (Elo) · 3471.0Elo · 51 vistas

DeepSeek lanza el modelo V4.1-Flash con soporte multimodal nativo

DeepSeek ha lanzado oficialmente el modelo DeepSeek-V4.1-Flash, que sirve como el miembro más pequeño de su nueva familia de arquitecturas y cuenta con comprensión visual multimodal nativa. Esta nueva arquitectura está diseñada para proporcionar un techo de capacidad más alto, velocidades de inferencia más rápidas, mayor rendimiento y mejor potencial de escalado para modelos más grandes.

media MarkTechPost · hace 18 d · 33 vistas

Google lanza comprensión de video agéntico para los modelos Gemini Flash

Google ha lanzado la comprensión de video agéntico en sus modelos Gemini Flash, reemplazando el método de procesamiento estático anterior con un sistema que navega por las líneas de tiempo de los videos bajo demanda. Este cambio permite que el modelo decida qué ver, a qué tasa de fotogramas y a través de qué modalidad, en lugar de ingerir toda la línea de tiempo a una fija de un fotograma por segundo.

arxiv arXiv cs.CL · hace 19 d · 36 vistas

VisCAD lanza una suite de modelos base con inteligencia multimodal para CAD industrial

Los investigadores presentan VisCAD, una suite de modelos base diseñada para ofrecer una generalización amplia y una capacidad sólida para el diseño realista de productos industriales. La suite aborda los desafíos de la generación a nivel de pieza a partir de diversas entradas como renders y texto, así como la generación a nivel de ensamblaje que involucra piezas interactivas.

lab Hugging Face Blog · hace 20 d · 34 vistas

NeoMME lanza codificadores multimodales eficientes con recuperación de interacción densa y tardía

Los investigadores presentan NeoMME, una familia de codificadores multimodales multilingües de 260M y 800M que procesan texto y parches de imagen crudos utilizando un único Transformer bidireccional. A diferencia de los modelos de lenguaje visual generativos, NeoMME no depende de torres visuales preentrenadas por separado ni de decodificadores causales; entrena todo el modelo desde cero con un objetivo de difusión discreta enmascarada.