Le développeur liventruth a open-sourcé l'Unified Latent-State Memory Fabric (UL-SMF), une architecture co-conçue matériel-logiciel qui compresse les caches Key-Value FP32 standards dans un espace latent discret de dimension 16 à l'aide de la Quantification d'Échelle Finie (FSQ).
- Atteint un taux de compression de 384x, réduisant un bloc FP32 de 48 Mo à 0,12 Mo.
- Maintient une similarité cosinus de 94,15 % à 95,84 % pour la rétention sémantique sur les tenseurs d'attention de LLM réels.
- Démonstre une latence de pipeline d'environ 14,1 ms à 19,6 ms lors de la vérification par événements CUDA end-to-end.
- Fournit un package Python autonome permettant aux utilisateurs de monkey-patcher les couches d'attention Transformer standard avec deux lignes de code.
UL-SMF vise à résoudre le goulot d'étranglement mémoire dans l'inférence Transformer à contexte long en combinant FSQ avec une cartographie latente dynamique, et est doublement sous licence AGPLv3 avec des options commerciales disponibles.