O projeto llama.cpp lançou a compilação b10896, que aborda um problema crítico onde a memória do redator falhava ao alocar novos tokens ao usar DFlash com modelos de visão. Essa falha ocorreu porque as imagens relatavam um deslocamento fixo, impedindo a alocação adequada de tokens.

  • A correção para a cópia dos deslocamentos de imagem permite que o redactor continue decodificando.
  • O salto do M-RoPE é limitado apenas a imagens, permitindo que o áudio passe inalterado.
  • Os comentários foram limpos para se alinhar com a lógica de implementação atualizada.

Esta atualização garante que a decodificação especulativa com DFlash funcione corretamente para modelos multimodais, resolvendo erros de alocação de memória causados pelo tratamento de metadados de imagem.