O projeto llama.cpp lançou a compilação b10237, que introduz o suporte à Predição de Múltiplos Tókenes (MTP) para o modelo DeepSeek V3.2.

  • A atualização habilita as capacidades do MTP especificamente para o DeepSeek V3.2 dentro do framework llama.
  • A lógica de descoberta do tipo de modelo foi ajustada para que as camadas do MTP não precisem ser incluídas explicitamente durante o processo de detecção.
  • Binários estão disponíveis para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) e openEuler.

Este lançamento permite que os usuários aproveitem o MTP com o DeepSeek V3.2 em uma ampla gama de arquiteturas de hardware e sistemas operacionais.