O desenvolvedor liventruth disponibilizou como código aberto o Unified Latent-State Memory Fabric (UL-SMF), uma arquitetura co-projetada de hardware e software que comprime caches Key-Value padrão FP32 em um espaço latente discreto de 16 dimensões usando Quantização Escalar Finita (FSQ).

  • Alcança uma taxa de compressão de 384x, reduzindo um bloco FP32 de 48 MB para 0,12 MB.
  • Mantém similaridade cossina entre 94,15% e 95,84% para retenção semântica em tensores de atenção de LLMs reais.
  • Demonstra latência de pipeline de aproximadamente 14,1 ms a 19,6 ms na verificação de eventos CUDA end-to-end.
  • Fornece um pacote Python autossuficiente que permite aos usuários fazer monkey-patch nas camadas de atenção padrão do Transformer com duas linhas de código.

O UL-SMF visa resolver o gargalo de memória na inferência de Transformers de contexto longo combinando FSQ com mapeamento latente dinâmico, sendo licenciado duplamente sob AGPLv3 com opções comerciais disponíveis.