Le projet llama.cpp a publié la compilation b10896, qui résout un problème critique où la mémoire du rédacteur échouait à allouer de nouveaux tokens lors de l'utilisation de DFlash avec des modèles de vision. Cet échec se produisait car les images rapportaient un décalage fixe, empêchant une allocation correcte des tokens.

  • La correction arrête la copie des décalages d'image pour permettre au rédacteur de continuer le décodage.
  • Le saut M-RoPE est limité aux images uniquement, permettant à l'audio de passer sans changement.
  • Les commentaires ont été nettoyés pour s'aligner sur la logique d'implémentation mise à jour.

Cette mise à jour garantit que le décodage spéculatif avec DFlash fonctionne correctement pour les modèles multimodaux en résolvant les erreurs d'allocation de mémoire causées par la gestion des métadonnées d'image.