Le projet llama.cpp a publié la version 0.5.0, en mettant l'accent sur les performances du backend, une couverture élargie des modèles et un fonctionnement serveur plus robuste. Cette mise à jour introduit le support de nouvelles architectures telles que HRM-Text (DFM Mimir 1B) et MiMo-V2.6, tout en améliorant considérablement l'efficacité computationnelle grâce aux optimisations CUDA et Metal.

  • Accélère les opérations CUDA conv2d en utilisant GEMM implicite.
  • Ajoute des optimisations de fusion pour Metal MoE et SSM_CONV.
  • Permet au serveur de se lier à plusieurs adresses via des adresses TCP séparées par des virgules et des sockets UNIX.
  • Active les sorties d'images à partir d'appels de fonctions en ajoutant le support de input_image.
  • Met à jour ggml vers la version v0.25.0, élargissant le support des hyperconnexions et de l'attention flash sur les backends.

La publication améliore la stabilité des enfants générés par le routeur et corrige plusieurs problèmes du parseur de chat, garantissant un fonctionnement plus fiable pour les utilisateurs déployant llama.cpp dans des environnements de production.