Le projet llama.cpp a publié la version b10098, qui inclut une mise à jour des opérations d'activation Hexagon. Cette version fournit des binaires pour macOS, Linux, Android, Windows et openEuler sur divers backends CPU et GPU.

  • Micro-noyau geglu tout-en-un optimisé (hex-geglu)
  • Activé la source non contiguë et le DMA en pas pour hex-geglu
  • Activé la source non contiguë et le DMA en pas pour le reste des opérations ACT
  • Généralisé les fonctions GLU par thread via la macro DEFINE_GLU_PER_THREAD
  • Déplacé UNARY_SILU et UNARY_GELU vers unary-ops
  • Remplacé l'utilisation générique du tampon ops_context par le calcul local htp_vtcm_layout