Qwen ha lanzado Qwen-AgentWorld-35B-A3B, un modelo MoE de 35B parámetros con solo unos 3B parámetros activos por token. Está entrenado para simular respuestas de entornos MCP, terminal, ingeniería de software, Android, web y GUI del sistema operativo, prediciendo las siguientes observaciones después de las acciones del agente, lo que permite un entrenamiento eficiente del agente y la simulación del entorno sin ejecución real de herramientas.
Qwen lanza MoE de 35B parámetros para simulación de entornos de agentes
Qwen3.6-27b-mtp-q8 crea una implementación de búsqueda de caminos A* mediante pruebas autónomas
El modelo Qwen3.6-27b-mtp-q8 generó con éxito una implementación de búsqueda de caminos A* para un juego de prueba basado en Java usando Claude Code localmente. El proceso involucró casi 12 horas de desarrollo iterativo donde el modelo creó y ejecutó autónomamente un conjunto de pruebas.
Qwen3.6-27B con 3-Critic Harness iguala la calidad de frontera
Un usuario probó Qwen3.6-27B (8-bit) junto a GLM5.2 utilizando un harness de codificación que emplea tres críticos—revisión de código, revisión de pruebas y Playwright e2e—para validar la calidad de la salida.
El arte ASCII permite a los LLM solo de texto controlar sistemas VLA
Un modelo de lenguaje grande solo de texto puede adaptarse en un controlador Visión--Lenguaje--Acción utilizando observaciones visuales renderizadas en ASCII. Este enfoque permite que los LLM interpreten estados visuales a través del texto, lo que les posibilita seguir instrucciones en lenguaje natural y generar acciones ejecutables tanto en simulación como en manipuladores físicos.
CORTIS: Adaptación de Modelos de Lenguaje Hablado Solo con Texto
CORTIS permite que los agentes de voz orientados a tareas generen salidas de habla estructuradas mediante el ajuste fino de modelos de lenguaje hablado utilizando únicamente supervisión de tareas en formato texto. Supera a las cascadas ASR-LLM bajo degradación acústica, especialmente en la preservación de la semántica de alto nivel de la tarea, sin requerir anotaciones emparejadas de habla-objetivo durante el entrenamiento.
Resultados actualizados del benchmark de modelos de visión y recomendaciones
Un benchmark revisado de modelos de lenguaje visual locales evalúa 23 modelos en 30 imágenes con 3 pruebas cada una, totalizando 2.070 pruebas y entre 60 y 70 horas de inferencia. El modelo con mejor rendimiento es Qwen3.6 27B (nothink) en Q4 con una puntuación de 79.6, seguido por Qwen3.5 4B (nothink) en Q4, y Qwen3-VL 8B en Q8. Los hallazgos clave incluyen que el modo de pensamiento degrada el rendimiento visual, los modelos MoE tienen un rendimiento inferior en comparación con los modelos densos, y la cuantización Q8 no mejora universalmente los resultados.