La version llama.cpp b10666 élargit la suite de tests de sauvegarde/chargement d'état pour s'exécuter sur toutes les architectures et résout plusieurs bugs critiques dans la gestion de l'état et le traitement du graphe. Les modifications clés incluent la correction des références pendantes dans minimax-01, l'alignement de la copie de chunks pour les séquences sur l'appareil, et la correction des comptes de têtes d'indexeur pour deepseek4.

  • La suite de tests de sauvegarde/chargement d'état s'exécute désormais contre chaque modèle *.gguf via un nouveau mode --models DIR, remplaçant la limitation précédente à un seul modèle.
  • La logique de copie de séquence d'état sur l'appareil a été assouplie pour gérer les sources non contiguës en utilisant un curseur d'octet au lieu d'exiger un alignement exact des chunks.
  • Les paramètres d'indexeur DSA factices ont été mis à jour (key_length=128, head_count=64) pour garantir que l'opération Lightning Indexer fusionnée s'exécute sur le GPU plutôt que de retomber sur le CPU.
  • Le compte de têtes d'indexeur de deepseek4 a été défini à 64 pour correspondre aux exigences du kernel corrigé, empêchant les avertissements de mismatch de périphérique.
  • Une référence hparams pendante dans l'entrée du graphe LA de minimax-01 a été remplacée par une copie pour prévenir la corruption de la mémoire pile lors de la réutilisation du graphe.

Ces mises à jour améliorent la couverture des tests et la stabilité pour les architectures complexes comme deepseek4, gemma2 et minimax-01, garantissant que la sérialisation d'état fonctionne correctement sur divers backends matériels.