llama.cpp v0.6.0 introduit la nouvelle API de lot étendu llama_batch_ext pour les entrées mixtes de tokens et d'embeddings, ainsi que le support du modèle hybride GLM-5.3-Flash 320B et du modèle de décision Clef.
- La nouvelle API llama_batch_ext prend en charge les embeddings d'état par token pour les modèles MTP et deepstack.
- Qwen4Exp offre désormais un support de haute qualité avec le décodage spéculatif MTP, offrant un gain de vitesse de décodage d'environ 1,5x sur DGX Spark.
- Une nouvelle API serveur /v1/systemone prend en charge cinq modèles de décision : laya, julia-1, lev, openjev et kev.
- Metal gagne un noyau flash attention pour l'API tensorielle avec KV F16 et des noyaux MMA mat-mul jusqu'à 3x plus rapides sur les GPU Apple.
- L'interface Web reçoit une refonte complète avec une couche de données Hugging Face Hub et un pipeline de téléchargement de modèles.
Cette version étend les capacités de llama.cpp pour le traitement multimodal, les performances du décodage spéculatif et l'intégration des modèles de décision.