Una comparación de GLM-5.3 y su variante destilada, GLM-5.3 Flash, en el benchmark DeepSWE revela que la destilación preserva la capacidad central de codificación mientras reduce significativamente los costos de rollout. El modelo completo logra una tasa de pass@1 del 69.0% a $3.99 por tarea, mientras que la variante Flash obtiene un puntaje de 63.4% a solo $0.24, lo que representa una reducción de precio de 17x.
- La brecha de calidad se reduce de 5.6 puntos en pass@1 a 2.6 puntos en pass@4 (87.6% vs 85.0%), lo que indica que la pérdida es principalmente de fiabilidad y no de capacidad.
- GLM-5.3 Flash cuesta $0.24 por rollout en comparación con $3.99 del modelo completo, lo que permite resolver 264 tareas por cada $100 frente a 17.
- La variante Flash pierde la capacidad de convertir esfuerzo adicional en éxito en tareas inestables, con intentos exitosos que requieren más pasos solo el 46% del tiempo en comparación con el 61% del modelo completo.
- La destilación remodeló el perfil de rendimiento, ganando terreno en concurrencia, Python y modelado de datos, mientras cede JavaScript y trabajos con muchas consultas.
- Una regresión notable es la reducción de cautela, con Flash fallando las pruebas base en el 6.9% de los rollouts frente al 4.4% del modelo completo.
Ejecutar GLM-5.3 Flash primero y escalar al modelo completo solo ante un rechazo resuelve el 80.9% de las tareas de DeepSWE a $1.70 cada una, ofreciendo una estrategia rentable para cargas de trabajo limitadas por rendimiento.