Tencent представляет KuaFu, единый слой сжатия поведения, который сводит сырую историю пользователя к компактным представлениям для диалоговых агентов и рекомендательных систем. Система использует двухосевой проектор для сжатия каждого элемента поведения до 2-4 токенов шириной 128-256, устраняя узкие места при обработке длинных последовательностей для миллиарда пользователей.
KuaFu соответствует или превосходит несжатые однозадачные производственные модели по четырем задачам профилирования, одновременно повышая пропускную способность на GPU на 37%-350% и экономя 190 GPU. На публичных бенчмарках он превосходит предыдущие компрессоры при том же соотношении сжатия, причем модель 4B превосходит аналогичную модель 8B на RecBench.
После работы на платформе рекламы и рекомендаций Tencent в течение десяти месяцев KuaFu увеличил общий GMV на 1.37%.