Le projet llama.cpp a publié la compilation b10150, qui inclut des ajustements à la logique ggml pour les opérations de déchargement vers le backend des poids. Cette mise à jour traite également des corrections pour le graphe llama dsv4.

  • ggml : ajuster la logique de déchargement des ops vers le backend des poids
  • llama : corrections du graphe dsv4

Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et iOS sur divers backends matériels, y compris CPU, CUDA, Vulkan, ROCm et OpenVINO.