研究人员提出了TokenProbe,这是一个解决思维链(Chain-of-Thought)推理中高令牌消耗问题的框架,它利用了序列中令牌值的非均匀性。该方法使用归一化对数概率来区分核心结构令牌和冗余填充物,从而实现选择性压缩。
- TokenProbe利用对数概率信号识别携带决定性推理内容的核心令牌与低置信度的探索性填充物。
- 它引入了一种高效的GRPO目标函数,选择性地压缩冗余令牌以改善准确性与令牌效率之间的权衡。
- 该方法在保持推理质量的同时,将令牌使用量减少了76%(相对于基线)。
- 在匹配的推理长度预算下,TokenProbe优于Gemini-3.1-Pro等强大的旗舰基线模型。
这项工作表明,压缩低价值令牌能带来帕累托改进,从而在不牺牲性能的情况下实现高效推理。