Le projet llama.cpp a publié la version 0.1.2, qui inclut une synchronisation avec ggml (passée à 0.20.2) et plusieurs mises à jour des composants serveur et interface utilisateur.

  • CUDA : MMVQ nwarps=8 pour bs=1 pour les modèles denses sur DGX Spark.
  • mtmd : utiliser sha256 pour le hachage de l'entrée.
  • vocab : prise en charge des scores entiers du tokeniseur.
  • mtmd : ignorer les vignettes pour les images LFM2 non tuilées.
  • server : enregistrer les chunks traités de mtmd comme espace réservé.
  • ui : imposer l'ordre alphabétique des membres d'énumération et refactoriser le nom des Outils intégrés.

Cette version inclut également des nettoyages de compilation pour xcframework + cmake et met à jour les processus CI pour la génération de versions préliminaires.