Разработчик liventruth открыл исходный код Unified Latent-State Memory Fabric (UL-SMF), архитектуры, совместно спроектированной на уровне аппаратного и программного обеспечения, которая сжимает стандартные FP32 Key-Value кэши в 16-мерное дискретное латентное пространство с помощью конечной скалярной квантования (FSQ).
- Достигает коэффициента сжатия 384x, уменьшая блок FP32 объемом 48 МБ до 0,12 МБ.
- Сохраняет косинусное сходство на уровне 94,15% - 95,84% для семантического сохранения в реальных тензорах внимания LLM.
- Демонстрирует латентность конвейера примерно от 14,1 мс до 19,6 мс при сквозной проверке событий CUDA.
- Предоставляет самодостаточный пакет Python, позволяющий пользователям применять monkey-patch к стандартным слоям внимания Transformer с помощью двух строк кода.
UL-SMF стремится решить проблему узкого места памяти при выводе длинных контекстов в Transformer, сочетая FSQ с динамическим отображением латентных пространств, и распространяется под двойной лицензией AGPLv3 с доступными коммерческими опциями.