O projeto llama.cpp lançou a compilação b10593, que aborda problemas críticos com a arquitetura do modelo DeepseekV4. A atualização resolve especificamente uma falha de rollback que ocorreu durante o processamento de múltiplas sequências.
- Corrige o tratamento do rollback do DeepseekV4 para contextos de múltiplas sequências.
- Corrige os procedimentos gerais de carregamento do modelo.
- Torna as operações de rollback pendentes de uso único para prevenir corrupção de estado.
- Garante que o cache seja limpo apenas para o ID da sequência específica durante carregamentos completos.
- Adiciona asserções para razões de compressão e torna a topologia do grafo estática.
Este lançamento melhora a estabilidade para usuários executando modelos DeepseekV4 com múltiplas sequências. Também fornece binários atualizados para macOS, Linux, Windows, Android e iOS em vários backends de hardware incluindo CPU, CUDA, ROCm e Vulkan.