Tema · Multimodal
lab DeepSeek API Docs · hace 14 d Codeforces (Elo) · 3471.0Elo · 55 vistas

DeepSeek lanza el modelo V4.1-Flash con soporte multimodal nativo

DeepSeek ha lanzado oficialmente el modelo DeepSeek-V4.1-Flash, que sirve como el miembro más pequeño de su nueva familia de arquitecturas y cuenta con comprensión visual multimodal nativa. Esta nueva arquitectura está diseñada para proporcionar un techo de capacidad más alto, velocidades de inferencia más rápidas, mayor rendimiento y mejor potencial de escalado para modelos más grandes.

media MarkTechPost · hace 6 d · 29 vistas

Alibaba Qwen lanza Qwen3.8-Omni-Flash, un modelo omnimodal agéntico con contexto de 1M

El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Omni-Flash, su primer modelo omnimodal diseñado en torno a capacidades agénticas para la comprensión de audio y video, así como el uso de herramientas. El modelo acepta entradas de texto, imágenes, audio y video para devolver salidas de texto, con una ventana de contexto de 1M de tokens y llamada de funciones nativa.

media MarkTechPost · hace 28 d · 74 vistas

El equipo de Qwen de Alibaba lanza Qwen3.8-Flash-Next, una vista previa de 125B que antecede a Qwen4

El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Flash-Next, un modelo Mixture-of-Experts multimodal de pesos abiertos diseñado para anticipar la arquitectura de la próxima serie Qwen4. El punto de control combina una columna vertebral de 125B con una tabla de incrustaciones N-gram de 51B y un módulo de predicción multi-token de 4B, activando solo 6B parámetros por token.

media MarkTechPost · hace 4 d · 21 vistas

El equipo de Alibaba Qwen lanza Qwen3.8-LiveTranslate con arquitectura Interleave

El equipo de Alibaba Qwen ha lanzado Qwen3.8-LiveTranslate, un modelo de interpretación simultánea en tiempo real de nueva generación que escucha el habla en vivo y devuelve texto y audio traducidos mientras el hablante aún está hablando. El lanzamiento introduce una nueva arquitectura Interleave diseñada para reducir la latencia y mejorar la calidad de la traducción.

lab Tencent Hunyuan (HF) · hace 6 d · 65 vistas

Tencent lanza WeVisDoc-4B, un analizador de documentos de extremo a extremo

Tencent ha lanzado WeVisDoc-4B, un analizador de documentos de extremo a extremo para imágenes de páginas que convierte las páginas en Markdown estructurado con fórmulas LaTeX y tablas HTML. Fine-tuneado desde Qwen3-VL-4B-Instruct, el modelo alcanza una puntuación general de 95.38 en OmniDocBench v1.6 y se clasifica primero entre los analizadores comparados en las cuatro configuraciones reportadas.

lab IBM Research (Granite) · hace 13 d · 25 vistas

IBM y NASA liberan el modelo base NASA-IBM Lunar Foundation Model de código abierto

IBM y NASA han liberado como código abierto el modelo base NASA-IBM Lunar Foundation Model, un sistema de IA que consolida décadas de datos lunares multimodales de misiones estadounidenses y japonesas en una única representación. Construido sobre la arquitectura TerraMind de IBM, el modelo integra observaciones a diferentes escalas y ángulos de visión para abordar desafíos como la iluminación compleja y la resolución de datos.