Multiverse Computing presenta la Curación Consciente de Cuantización (QAH), un método que destila grandes modelos de lenguaje comprimidos y cuantizados directamente a partir de sus maestros originales previos a la compresión. Aplicado a un modelo GPT-OSS 120B comprimido a 60B parámetros y cuantizado a MXFP4, el enfoque produce un modelo que supera su propia versión bfloat16 de precisión completa en 7 de los 9 benchmarks.

  • El modelo QAH supera al maestro original de 120B en LiveCodeBench (66.5 frente a 66.0) y logra grandes mejoras en el razonamiento de contexto largo (+7.4 en AA-LCR) y matemáticas (+5.6 en AIME 2025).
  • En comparación con el entrenamiento consciente de cuantización (QAT), QAH alcanza su rendimiento máximo en aproximadamente 100 pasos, unas 7 veces más rápido, evitando el colapso agudo de precisión observado en QAT después del paso 700.
  • El método utiliza una pérdida de divergencia KL fragmentada y eficiente en memoria para manejar la curación de contexto largo hasta 32k tokens sin materializar la cuadrícula completa vocabulario-por-seuencia.

Esta técnica permite que los modelos comprimidos sean más pequeños, más baratos de servir y más precisos que sus contrapartes no comprimidas, invirtiendo efectivamente el compromiso habitual entre eficiencia y capacidad.