A Multiverse Computing apresenta o Healing Consciente de Quantização (QAH), um método que destila grandes modelos de linguagem comprimidos e quantizados diretamente a partir de seus professores originais pré-compressão. Aplicado a um modelo GPT-OSS 120B comprimido para 60B parâmetros e quantizado para MXFP4, a abordagem produz um modelo que supera sua própria versão bfloat16 de precisão completa em 7 dos 9 benchmarks.

  • O modelo QAH supera o professor original de 120B no LiveCodeBench (66,5 vs. 66,0) e alcança grandes ganhos no raciocínio de contexto longo (+7,4 no AA-LCR) e em matemática (+5,6 no AIME 2025).
  • Em comparação com o treinamento consciente de quantização (QAT), o QAH atinge o pico de desempenho em aproximadamente 100 etapas, cerca de 7 vezes mais rápido, evitando o colapso acentuado de precisão observado no QAT após a etapa 700.
  • O método utiliza uma perda de divergência KL em chunks com eficiência de memória para lidar com a cura de contexto longo até 32k tokens sem materializar a grade completa vocabulário-por-sequência.

Esta técnica permite que modelos comprimidos sejam menores, mais baratos de servir e mais precisos do que suas contrapartes não comprimidas, invertendo efetivamente o trade-off usual entre eficiência e capacidade.