Разработчик liventruth открыл исходный код Unified Latent-State Memory Fabric (UL-SMF), архитектуры, совместно спроектированной на уровне аппаратного и программного обеспечения, которая сжимает стандартные FP32 Key-Value кэши в 16-мерное дискретное латентное пространство с помощью конечной скалярной квантования (FSQ).

  • Достигает коэффициента сжатия 384x, уменьшая блок FP32 объемом 48 МБ до 0,12 МБ.
  • Сохраняет косинусное сходство на уровне 94,15% - 95,84% для семантического сохранения в реальных тензорах внимания LLM.
  • Демонстрирует латентность конвейера примерно от 14,1 мс до 19,6 мс при сквозной проверке событий CUDA.
  • Предоставляет самодостаточный пакет Python, позволяющий пользователям применять monkey-patch к стандартным слоям внимания Transformer с помощью двух строк кода.

UL-SMF стремится решить проблему узкого места памяти при выводе длинных контекстов в Transformer, сочетая FSQ с динамическим отображением латентных пространств, и распространяется под двойной лицензией AGPLv3 с доступными коммерческими опциями.