O projeto llama.cpp lançou a compilação b10896, que aborda um problema crítico onde a memória do redator falhava ao alocar novos tokens ao usar DFlash com modelos de visão. Essa falha ocorreu porque as imagens relatavam um deslocamento fixo, impedindo a alocação adequada de tokens.
- A correção para a cópia dos deslocamentos de imagem permite que o redactor continue decodificando.
- O salto do M-RoPE é limitado apenas a imagens, permitindo que o áudio passe inalterado.
- Os comentários foram limpos para se alinhar com a lógica de implementação atualizada.
Esta atualização garante que a decodificação especulativa com DFlash funcione corretamente para modelos multimodais, resolvendo erros de alocação de memória causados pelo tratamento de metadados de imagem.