Le projet llama.cpp a publié la version 0.1.2, qui inclut une synchronisation avec ggml (passée à 0.20.2) et plusieurs mises à jour des composants serveur et interface utilisateur.
- CUDA : MMVQ nwarps=8 pour bs=1 pour les modèles denses sur DGX Spark.
- mtmd : utiliser sha256 pour le hachage de l'entrée.
- vocab : prise en charge des scores entiers du tokeniseur.
- mtmd : ignorer les vignettes pour les images LFM2 non tuilées.
- server : enregistrer les chunks traités de mtmd comme espace réservé.
- ui : imposer l'ordre alphabétique des membres d'énumération et refactoriser le nom des Outils intégrés.
Cette version inclut également des nettoyages de compilation pour xcframework + cmake et met à jour les processus CI pour la génération de versions préliminaires.