El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Omni-Flash, su primer modelo omnimodal diseñado en torno a capacidades agénticas para la comprensión de audio y video, así como el uso de herramientas. El modelo acepta entradas de texto, imágenes, audio y video para devolver salidas de texto, con una ventana de contexto de 1M de tokens y llamada de funciones nativa.
- Basado en la arquitectura Qwen3.8-Flash-Next, ofrece un contexto de 1M de tokens con un máximo de 991K tokens de entrada y 131K tokens de salida.
- Emplea un flujo de percepción agéntico para videos largos, aumentando la precisión de OmniVideoBench de 63.4 a 67.8 mientras reduce el uso de tokens en un 45.7%.
- El modelo muestra ganancias significativas de rendimiento frente a Qwen3.5-Omni-Plus, con puntajes promedio que mejoran más del 25% en 29 evaluaciones.
- Está disponible a través de la API en QwenCloud, Alibaba Cloud Model Studio y Qwen Studio, con precios de $0.15 por cada 1M tokens de entrada y $0.47 por cada 1M tokens de salida.
- El equipo también liberó bajo licencia Apache-2.0 los Qwen-MM-Plugins para soportar entornos de agentes multimodales.
El lanzamiento proporciona una solución alojada para flujos de trabajo agénticos complejos que involucran análisis de audio y video de larga duración, con reducciones de costos reportadas de más del 93% para entradas audiovisuales en comparación con modelos anteriores.