El desarrollador liventruth ha liberado como código abierto el Unified Latent-State Memory Fabric (UL-SMF), una arquitectura co-diseñada a nivel hardware y software que comprime los cachés Key-Value estándar FP32 en un espacio latente discreto de 16 dimensiones utilizando Finite Scalar Quantization (FSQ).
- Logra una relación de compresión de 384x, reduciendo un bloque FP32 de 48 MB a 0.12 MB.
- Mantiene una similitud coseno del 94.15% - 95.84% para la retención semántica en tensores de atención de LLM reales.
- Demuestra una latencia de pipeline de aproximadamente 14.1 ms a 19.6 ms en verificación de eventos CUDA end-to-end.
- Proporciona un paquete Python autocontenido que permite a los usuarios parchear dinámicamente las capas de atención estándar del Transformer con dos líneas de código.
UL-SMF tiene como objetivo resolver el cuello de botella de memoria en la inferencia de Transformers de contexto largo combinando FSQ con mapeo latente dinámico, y está licenciado bajo AGPLv3 con opciones comerciales disponibles.