Tencent présente KuaFu, une couche unifiée de compression du comportement qui condense l'historique brut de l'utilisateur en représentations compactes pour les agents conversationnels et les recommandeurs. Le système utilise un projecteur à deux axes pour compresser chaque élément de comportement en 2-4 tokens de largeur 128-256, adressant les goulots d'étranglement dans le traitement des séquences longues pour un milliard d'utilisateurs.

KuaFu égale ou dépasse les modèles de production à tâche unique non compressés sur quatre tâches de profilage, tout en augmentant le débit par GPU de 37% à 350% et en économisant 190 GPUs. Sur les benchmarks publics, il surpasse les compresseurs précédents au même ratio, un modèle 4B surpassant son homologue 8B sur RecBench.

Après avoir fonctionné sur la plateforme de publicité et de recommandation de Tencent pendant dix mois, KuaFu a augmenté le GMV global de 1.37%.