El modelo Qwen-AgentWorld-35B-A3B muestra un rendimiento sólido en tareas de programación, con una puntuación de 65.63% en la Evaluación de Escritura de Software y 65.92% en el benchmark general. Supera a Qwen3.5-35B-A3B y compite con modelos más grandes en tareas basadas en agentes, con una primera impresión que destaca su mayor precisión en flujos de trabajo de agentes a largo plazo.
¿Qwen-AgentWorld-35B-A3B para programación?
Benchmarks locales con una RTX 3090 - Qwen3.6 27b vs Ornith
Un usuario comparó Qwen3.6 27b, Gemma4 26B A4B QAT y Ornith1.0 35B MoE utilizando el framework inspect-ai en una RTX 3090 para evaluar el rendimiento de modelos locales. Las pruebas revelaron resultados mixtos en benchmarks de conocimiento general, fundamentación y codificación, con Qwen3.6 liderando generalmente en puntuaciones mientras que Ornith mostró fortalezas en áreas específicas como DROP.
GLM 5.2 Q1_S vs Qwen 27B Q8: Una comparación de LLM local
Una comparación amateur en hardware de consumo demuestra que el GLM-5.2 altamente cuantizado (Q1_S) supera al Qwen 3.6 27B de mayor precisión (Q8) en una tarea de codificación compleja, a pesar de velocidades de inferencia significativamente más lentas.
Qwen3.6 27B local vs Opus 4.8, motor de voxel en C puro sin frameworks
Un experimento comparativo enfrentó a Claude Code con Opus 4.8 contra un modelo Qwen3.6 27B ejecutándose localmente para construir un motor de mundo de voxel en C plano sin ningún framework o librería externa.
LLMs evaluados para la detección de vulnerabilidades web
Un estudio evalúa seis LLMs en la detección de vulnerabilidades web del mundo real en plugins de WordPress, encontrando que las tasas de detección varían según el modelo y el diseño del prompt. Claude Opus 4.6 logró la tasa de detección más alta con un 63%, mientras que Qwen 3.5 solo alcanzó un 35%, y ningún modelo identificó consistentemente todas las vulnerabilidades de referencia a través de las iteraciones.
CORTIS: Adaptación de Modelos de Lenguaje Hablado Solo con Texto
CORTIS permite que los agentes de voz orientados a tareas generen salidas de habla estructuradas mediante el ajuste fino de modelos de lenguaje hablado utilizando únicamente supervisión de tareas en formato texto. Supera a las cascadas ASR-LLM bajo degradación acústica, especialmente en la preservación de la semántica de alto nivel de la tarea, sin requerir anotaciones emparejadas de habla-objetivo durante el entrenamiento.