O projeto llama.cpp lançou a compilação b10762, que introduz suporte para o modelo DeepSeek-V4-Flash-Vision-Exp. Esta atualização também inclui o tratamento de contagens mínimas e máximas de tokens pela interface de linha de comando.
As principais alterações nesta versão incluem:
- Adicionado suporte mtmd para DeepSeek-V4-Flash-Vision-Exp.
- Implementado tratamento para contagens de tokens min/max via CLI.
- Mudado para usar GGML_ROPE_TYPE_VISION.
- Corrigida a lógica de contagem de tokens e removido o código de depuração.
O lançamento fornece binários para macOS, Linux, Windows, Android e iOS em vários backends de hardware incluindo CPU, CUDA, ROCm, Vulkan e OpenVINO.