Pengembang liventruth telah membuka sumber Fabric Memori Keadaan laten Terpadu (UL-SMF), sebuah arsitektur yang dirancang bersama perangkat keras-perangkat lunak yang mengompres cache Key-Value FP32 standar ke dalam ruang laten diskrit berdimensi 16 menggunakan Kuantisasi Skalar Hingga (FSQ).
- Mencapai rasio kompresi 384x, mengurangi blok FP32 berukuran 48 MB menjadi 0,12 MB.
- Mempertahankan kesamaan kosinus sebesar 94,15% - 95,84% untuk retensi semantik pada tensor perhatian LLM nyata.
- Menunjukkan latensi pipa sekitar 14,1 ms hingga 19,6 ms dalam verifikasi peristiwa CUDA end-to-end.
- Menyediakan paket Python mandiri yang memungkinkan pengguna mem-patch lapisan perhatian Transformer standar dengan dua baris kode.
UL-SMF bertujuan mengatasi hambatan memori dalam inferensi Transformer konteks panjang dengan menggabungkan FSQ dengan pemetaan laten dinamis, dan dilisensikan ganda di bawah AGPLv3 dengan opsi komersial tersedia.