DiffusionGemma 26B funciona a hasta 475t/s en un 4090 mediante vLLM con cuantización INT4 AWQ, alcanzando velocidades entre 290t/s y 700t/s según la longitud de salida. Sin embargo, sufre de operación para un solo usuario, menor precisión de respuesta, pérdida rápida del contexto y mayor tiempo hasta el primer token en comparación con los modelos estándar de 26B.
DiffusionGemma 26B en 4090 alcanza 475t/s con limitaciones
GLM 5.2 alcanza el 98% de inteligencia máxima con menos de la mitad de tokens
GLM 5.2 demuestra el 98% de su inteligencia máxima en tareas de codificación utilizando menos de la mitad de su presupuesto total de tokens, según un informe técnico de z_ai. La eficiencia de razonamiento del modelo ha mejorado significativamente, con un aumento en el uso de tokens de 16.7k a 36.7k entre GLM 5.1 y GLM 5.2, aunque las configuraciones de alto nivel pueden sobrecargar el rendimiento del hardware local.
El costo de $1800 en GPU ejecuta Qwen3.6-27B con contexto de 262K y 55 tok/s
Una configuración con cuatro GPUs 5060 Ti (totalizando $1800) logra 55 tokens por segundo con Qwen3.6-27B-FP8, soportando una longitud de contexto de 262K y caché KV bfloat16. La configuración utiliza P2P y FlashInfer, con resultados de benchmark que muestran un rendimiento de salida de 55.67 tokens y una tasa de aceptación de decodificación especulativa del 65.25%.
Discrepancia entre el rendimiento de Llama Bench y el del mundo real
El usuario reporta una brecha significativa entre los resultados de las pruebas de Llama y el rendimiento real del modelo. Las pruebas muestran 754 tk/s de prefill y 36 tk/s de generación, pero el uso real revela solo 7.98 tokens por segundo, con alta latencia y bajo throughput. La discrepancia se atribuye a las condiciones de uso en el mundo real, no a la configuración de las pruebas, lo que sugiere que el rendimiento real del modelo está muy por debajo de la velocidad medida en las pruebas.
SwiftTrans mejora la eficiencia de traducción de código en LLM
SwiftTrans aborda las brechas de eficiencia en tiempo de ejecución en la traducción de código basada en LLM mediante la introducción de Exploración Multi-Perspectiva y Selección Consciente de Diferencias. El marco extiende CodeNet, F2SBench e introduce SwiftBench para evaluar el rendimiento en tiempo de ejecución, mostrando mejoras consistentes tanto en corrección como en eficiencia a través de las pruebas.
Qxern-v6 utiliza tokens latentes y un sidecar AST para una transferencia de código más rápida y precisa
El sistema Qxern-v6 permite que dos LLM se comuniquen mediante 32 tokens latentes comprimidos mientras preserva la exactitud de los símbolos a través de un sidecar de Abstract Syntax Tree (AST) determinista adaptativo. Desarrollado por un desarrollador de 15 años, la arquitectura utiliza Qwen2.5-Coder-1.5B para comprimir el código y un decodificador congelado Qwen3.5-0.8B para interpretarlo sin ver texto en bruto.