Le projet llama.cpp a publié la version b11062, qui inclut une demande de tirage permettant le support de l'attention flash (FA) clairsemée pour le modèle Qwen4.

Cette mise à jour fait partie du lancement plus large de la version b11062, qui fournit des binaires pour macOS, Linux, Windows, Android et openEuler sur CPU, GPU (CUDA, ROCm, Vulkan) et accélérateurs IA.

La modification spécifique mentionnée dans les notes de version ajoute des capacités FA clairsemées pour Qwen4 afin d'améliorer l'efficacité.