Le développeur liventruth a open-sourcé l'Unified Latent-State Memory Fabric (UL-SMF), une architecture co-conçue matériel-logiciel qui compresse les caches Key-Value FP32 standards dans un espace latent discret de dimension 16 à l'aide de la Quantification d'Échelle Finie (FSQ).

  • Atteint un taux de compression de 384x, réduisant un bloc FP32 de 48 Mo à 0,12 Mo.
  • Maintient une similarité cosinus de 94,15 % à 95,84 % pour la rétention sémantique sur les tenseurs d'attention de LLM réels.
  • Démonstre une latence de pipeline d'environ 14,1 ms à 19,6 ms lors de la vérification par événements CUDA end-to-end.
  • Fournit un package Python autonome permettant aux utilisateurs de monkey-patcher les couches d'attention Transformer standard avec deux lignes de code.

UL-SMF vise à résoudre le goulot d'étranglement mémoire dans l'inférence Transformer à contexte long en combinant FSQ avec une cartographie latente dynamique, et est doublement sous licence AGPLv3 avec des options commerciales disponibles.