Le projet llama.cpp a publié la compilation b10762, qui introduit le support pour le modèle DeepSeek-V4-Flash-Vision-Exp. Cette mise à jour inclut également la gestion des comptes minimum et maximum de tokens depuis l'interface en ligne de commande.

Les changements clés dans cette version incluent :

  • Ajout du support mtmd pour DeepSeek-V4-Flash-Vision-Exp.
  • Implémentation de la gestion des comptes min/max de tokens via CLI.
  • Passage à l'utilisation de GGML_ROPE_TYPE_VISION.
  • Correction de la logique de comptage des tokens et suppression du code de débogage.

La version fournit des binaires pour macOS, Linux, Windows, Android et iOS sur divers backends matériels incluant CPU, CUDA, ROCm, Vulkan et OpenVINO.