Un análisis detallado mapea la KLD (divergencia de Kullback-Leibler) de la cuantización del KV cache para los modelos Qwen3.6-35B-A3B y Gemma4-E2B. Los resultados muestran que la cuantización q8/q8 es casi sin pérdidas en ambos modelos, mientras que q4/q4 funciona bien en Qwen pero causa una degradación severa en Gemma. Las variantes de cuantización Turbo muestran un rendimiento mixto, con turbo3 y turbo2 permitiendo una compresión extrema del cache a costa significativa de la precisión.
Análisis KLD de la cuantización del KV Cache para Qwen3.6-35B-A3B y Gemma4-E2B QAT
Destilar deepseek-r1:8B en Qwen3-0.6B permite un enriquecimiento de texto estructurado rápido en el dispositivo
Los investigadores demuestran que destilar un maestro de razonamiento de 8B (deepseek-r1:8B) en un modelo estudiante de 0.6B (Qwen3-0.6B mediante QLoRA) permite una extracción estructurada de alto volumen con latencia y costo significativamente menores. El estudio evalúa este enfoque mapeando artículos de noticias a objetos JSON que contienen resúmenes y etiquetas categóricas, comparando el modelo destilado contra líneas base de prompting few-shot y decodificación restringida.
SpectralQuant Qwen3.5 0.8B Q4_K_M recupera el 96,5 % de la brecha de BF16
Spectral Labs ha publicado una candidata a lanzamiento para una cuantización Q4_K_M consciente de la calibración del modelo Qwen3.5 0.8B, utilizando un nuevo método llamado SpectralQuant. Este enfoque busca que las huellas estándar de Q4_K_M se comporten más como formatos de cuantización mayores mientras mantiene la compatibilidad con llama.cpp.
Localización automatizada de fallos semánticos en SysML v2 mediante LLMs aumentados con grafos de conocimiento
Este artículo presenta un marco de trabajo humano-en-el-bucle para identificar y reparar automáticamente errores semánticos en modelos SysML v2 que los compiladores no pueden detectar. El enfoque combina Pequeños Modelos de Lenguaje ajustados finamente con un grafo de conocimiento del dominio para fundamentar las sugerencias de reparación en restricciones de ingeniería válidas.
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia con 240 elementos de prueba en árabe en ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación con el árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia de 240 elementos de prueba en árabe a través de ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación en árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.