O projeto llama.cpp lançou a compilação b11330, que introduz o suporte à Predição de Múltiplos Tokens (MTP) especificamente para o modelo Qwen4Exp. Esta atualização faz parte de um lançamento mais amplo que fornece binários para macOS, Linux, Windows, Android e iOS em vários backends de hardware.

  • Adiciona funcionalidade MTP para modelos Qwen4Exp via pull request #29761.
  • Remove o membro `has_state` em favor de verificar se `ctx_bufs` não está vazio.
  • Inclui limpeza de código com convenções de nomenclatura consistentes e redução da verbosidade nos comentários.
  • Fornece binários pré-compilados para CPU, GPU (CUDA, Vulkan, ROCm, OpenCL) e NPU (Snapdragon Hexagon).

Este lançamento permite que os usuários aproveitem as capacidades MTP dentro do llama.cpp enquanto mantém a compatibilidade com as configurações de hardware existentes.