llama.cpp 0.3.0 introduit la prise en charge du modèle multimodal dots3-note avec un nouveau type de cache KV DSA-ISWA, ainsi que la prise en charge de la prédiction multi-tokens (MTP) pour GLM-4.5-Air. La version ajoute également des capacités de répartition de tenseur pour DeepSeek 4 et corrige les problèmes de rollback multi-séquences.

  • ggml est mis à jour vers v0.22.0, ajoutant le support de la répartition de tenseur au meta-backend et aux noyaux Metal par opération avec compilation parallèle.
  • mtmd gagne en support visuel/audio dots3-note, le décodage WebP via ffmpeg, et un algorithme de redimensionnement précis selon Pillow.
  • DeepSeek 4 reçoit le mode de répartition de tenseur via l'indicateur `-sm tensor` et des corrections pour le rollback avec plusieurs séquences.
  • Le serveur ajoute un bouton de débogage `LLAMA_SERVER_SLOTS_N_DIFF`, tandis que l'interface web gagne une navigation par onglets pour les chats.

Cette mise à jour étend les capacités multimodales de llama.cpp et améliore les performances et la stabilité pour des architectures de modèles spécifiques comme DeepSeek 4 et GLM-4.5-Air.