O projeto llama.cpp adicionou suporte à decodificação especulativa DFlash com o modelo HunyuanOCR, expondo tensores de entrada das camadas no grafo alvo. Essa alteração permite que o modelo de rascunho leia os fluxos residuais, possibilitando que solicitações de imagem sejam executadas com sucesso, apresentando uma taxa de aceitação de rascunho de aproximadamente 0,5 e saída OCR idêntica em bytes em comparação às execuções não especulativas.
A atualização também corrige a conversão do rascunho DFlash contra alvos HunYuan, resolvendo duas falhas específicas: um AttributeError causado pelo tratamento de vocabulário não vinculado e pesquisas de configuração que liam incorretamente parâmetros de rascunho em vez das configurações alvo. Essas correções garantem que a conversão dos rascunhos DFlash tencent/HunyuanOCR seja bem-sucedida para os checkpoints das versões 1.5 e v1.0, sem alterar as conversões do modelo base.
Essas alterações permitem a decodificação especulativa eficiente para modelos baseados em Hunyuan no llama.cpp, melhorando a velocidade de inferência enquanto mantém a fidelidade da saída.