Un benchmark revisado de modelos de lenguaje visual locales evalúa 23 modelos en 30 imágenes con 3 pruebas cada una, totalizando 2.070 pruebas y entre 60 y 70 horas de inferencia. El modelo con mejor rendimiento es Qwen3.6 27B (nothink) en Q4 con una puntuación de 79.6, seguido por Qwen3.5 4B (nothink) en Q4, y Qwen3-VL 8B en Q8. Los hallazgos clave incluyen que el modo de pensamiento degrada el rendimiento visual, los modelos MoE tienen un rendimiento inferior en comparación con los modelos densos, y la cuantización Q8 no mejora universalmente los resultados.
Resultados actualizados del benchmark de modelos de visión y recomendaciones
Qwen lanza MoE de 35B parámetros para simulación de entornos de agentes
Qwen ha lanzado Qwen-AgentWorld-35B-A3B, un modelo MoE de 35B parámetros con solo unos 3B parámetros activos por token. Está entrenado para simular respuestas de entornos MCP, terminal, ingeniería de software, Android, web y GUI del sistema operativo, prediciendo las siguientes observaciones después de las acciones del agente, lo que permite un entrenamiento eficiente del agente y la simulación del entorno sin ejecución real de herramientas.
Alibaba anuncia Qwen 3.8 Max, un modelo de 2.4T parámetros con pesos abiertos que llegará la próxima semana
El equipo de Qwen de Alibaba ha anunciado Qwen 3.8 Max, un nuevo modelo insignia de 2.4T parámetros centrado en codificación, trabajo agénico a largo plazo y razonamiento multimodal. La compañía confirmó que las versiones de pesos abiertos tanto de Qwen 3.8 Max como del más pequeño Qwen 3.8-27B se lanzarán la próxima semana.
Qwen3.8-Max realiza one-shot en 35 prompts, incluida la simulación de un acuario roto
El artículo destaca el rendimiento de Qwen3.8-Max en un contexto de evaluación one-shot, señalando su capacidad para manejar simulaciones físicas complejas.
Microsoft lanza Mage-VL, un modelo multimodal de streaming nativo de códec
Microsoft ha lanzado Mage-VL, un modelo base multimodal eficiente de 4B de parámetros para la comprensión de imágenes y video que utiliza un enfoque nativo de códec para optimizar el procesamiento visual. El sistema separa los flujos de video en fotogramas ancla (I) y predichos (P), conservando solo los parches donde el códec asigna bits para reducir el consumo de tokens visuales en más del 75%.
Lanzamiento de peso abierto de Qwen3.8, Kimi Code CLI, pila LLM de Netflix, software de chip de Alibaba
Alibaba anunció el lanzamiento de peso abierto de Qwen3.8, un modelo de 2,4 billones de parámetros, mientras también liberaba como código abierto su pila de software del chip AI Zhenwu para reducir la dependencia del ecosistema CUDA de Nvidia.