Tencent presenta KuaFu, una capa unificada de compresión de comportamiento que condensa el historial crudo del usuario en representaciones compactas para agentes conversacionales y sistemas de recomendación. El sistema utiliza un proyector de dos ejes para comprimir cada elemento de comportamiento en 2-4 tokens de ancho 128-256, abordando los cuellos de botella en el procesamiento de secuencias largas para mil millones de usuarios.

KuaFu iguala o supera a los modelos de producción de tarea única no comprimidos en cuatro tareas de perfilado, mientras aumenta el rendimiento por GPU entre un 37% y un 350% y ahorra 190 GPUs. En benchmarks públicos, supera a compresores anteriores con la misma relación, con un modelo de 4B superando a su contraparte de 8B en RecBench.

Después de funcionar en la plataforma de publicidad y recomendación de Tencent durante diez meses, KuaFu elevó el GMV total en un 1.37%.