O projeto llama.cpp lançou a versão b10906, que inclui uma correção para o componente do servidor referente à decodificação especulativa após entradas de imagem. A alteração garante que a posição real seja passada ao redator em vez da contagem de tokens, afetando todos os redatores e não apenas o DFlash.
- Renomeado o parâmetro de rascunho `n_past` para `pos0` para refletir com precisão seu papel como indicador de posição em vez de uma contagem de tokens.
- Fornecidos binários pré-compilados para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.
Esta atualização corrige uma inconsistência no nome do parâmetro e garante o tratamento adequado da posição na lógica de decodificação especulativa do servidor.