Les chercheurs présentent CliffCompaction, une technique d'autocompaction conçue pour les agents traitant des millions de tokens, qui réduit les coûts jusqu'à 50 % dans un contexte borné. La méthode maintient ou améliore les performances sur Terminal-Bench et atteint des résultats de pointe sur KernelBench en conservant la fidélité de l'information par troncature plutôt que par reformulation.

  • CliffCompaction ajoute plus de 10 points de pourcentage sur Terminal-Bench pour moins que le coût de deux exécutions à contexte complet.
  • Sous mise à l'échelle parallèle au moment du test, il permet à Kimi K2.6 d'égaler Opus 4.7 et de dépasser Opus 4.6 et GPT-5.3 Codex à moindre coût.
  • La technique empêche la dérive du contexte en ne compactant jamais une compaction, opérant uniquement sur le contenu original et rejetant les sorties antérieures.
  • Sur KernelBench, il atteint des accélérations de noyau CUDA de $2.23 imes$ après 200 étapes et $3.58 imes$ après 400 étapes.
  • Une implémentation API-proxy agnostique au scaffold est open-sourcée pour une utilisation avec Claude Code, Codex et d'autres frameworks.

CliffCompaction rend le compromis performance-coût de la mise à l'échelle au moment du test plus efficace et soutient l'apprentissage continu sur des sessions dépassant un million de tokens.