O projeto llama.cpp lançou a compilação b11330, que introduz o suporte à Predição de Múltiplos Tokens (MTP) especificamente para o modelo Qwen4Exp. Esta atualização faz parte de um lançamento mais amplo que fornece binários para macOS, Linux, Windows, Android e iOS em vários backends de hardware.
- Adiciona funcionalidade MTP para modelos Qwen4Exp via pull request #29761.
- Remove o membro `has_state` em favor de verificar se `ctx_bufs` não está vazio.
- Inclui limpeza de código com convenções de nomenclatura consistentes e redução da verbosidade nos comentários.
- Fornece binários pré-compilados para CPU, GPU (CUDA, Vulkan, ROCm, OpenCL) e NPU (Snapdragon Hexagon).
Este lançamento permite que os usuários aproveitem as capacidades MTP dentro do llama.cpp enquanto mantém a compatibilidade com as configurações de hardware existentes.