Le projet llama.cpp a publié la version b10730, qui inclut des optimisations pour l'architecture du modèle Qwen4exp. Le changement principal consiste à additionner les têtes indexeur par tranches au lieu d'utiliser une opération de transposition et de sum_rows, réduisant ainsi la surcharge de copie mémoire.

  • La vitesse de traitement des prompts est passée de 2170 à 2366 tokens par seconde sur une RTX PRO 6000 avec Qwen3.8-Flash-Next UD-Q4_K_XL.
  • L'optimisation supprime les exigences redondantes de tenseur contigu pour la requête indexeur, car rope retourne un tenseur contigu fraîchement alloué.
  • La vitesse de génération reste inchangée, mais le gain dans le traitement des prompts s'échelle avec la longueur du contexte et la taille ubatch.
  • La sortie greedy est inchangée token par token par rapport aux versions précédentes.

Cette mise à jour améliore l'efficacité pour les tâches d'inférence à long contexte impliquant des modèles Qwen4exp en réduisant le gaspillage computationnel lors de la phase de traitement des prompts.