Tencent memperkenalkan KuaFu, lapisan kompresi perilaku terpadu yang memadatkan riwayat pengguna mentah menjadi representasi kompak untuk agen percakapan dan sistem rekomendasi. Sistem ini menggunakan proyektor dua sumbu untuk mengompresi setiap item perilaku menjadi 2-4 token dengan lebar 128-256, mengatasi hambatan dalam memproses urutan panjang untuk satu miliar pengguna.
KuaFu menyamai atau melampaui model produksi tugas tunggal yang tidak terkompresi di empat tugas pemprofilan, sambil meningkatkan throughput per-GPU sebesar 37%-350% dan menghemat 190 GPU. Pada benchmark publik, ia mengungguli kompresor sebelumnya pada rasio yang sama, dengan model 4B melampaui rekan 8B-nya di RecBench.
Setelah berjalan di platform iklan dan rekomendasi Tencent selama sepuluh bulan, KuaFu meningkatkan GMV keseluruhan sebesar 1.37%.