A Tencent apresenta o KuaFu, uma camada unificada de compressão de comportamento que condensa o histórico bruto do usuário em representações compactas para agentes conversacionais e recomendadores. O sistema usa um projetor de dois eixos para comprimir cada item de comportamento em 2-4 tokens de largura 128-256, abordando gargalos no processamento de sequências longas para um bilhão de usuários.
O KuaFu iguala ou excede modelos de produção de tarefa única não comprimidos em quatro tarefas de perfilamento, ao mesmo tempo que aumenta a taxa de transferência por GPU em 37%-350% e economiza 190 GPUs. Em benchmarks públicos, ele supera compressores anteriores na mesma proporção, com um modelo de 4B superando sua contraparte de 8B no RecBench.
Após funcionar na plataforma de publicidade e recomendação da Tencent por dez meses, o KuaFu elevou o GMV geral em 1.37%.