llama.cpp version 0.4.0 introduit le support d'architecture initial pour les modèles Qwen3.8-Flash-Next et NVIDIA Nemotron-3-Puzzle-75B-A9B, ainsi qu'une mise à jour de la bibliothèque sous-jacente ggml vers la version 0.23.0.

  • Ajout de la lecture paresseuse de tenseurs à la demande et des limites de contexte serveur par slot.
  • Mise à jour de ggml vers 0.23.0 avec l'attention flash clairsemée et le support du transport Apple RDMA.
  • Introduction des options d'entrée vidéo, de la recherche d'historique n-gramme et des plafonds de RAM pour le quantiseur.
  • Activation par défaut de `preserve_reasoning` dans le serveur et amélioration des assistants de tokenisation multimodale.

Ces modifications étendent la compatibilité des modèles et offrent aux développeurs un contrôle plus fin sur l'utilisation de la mémoire et l'allocation des ressources du serveur.