研究人员提出了TokenProbe,这是一个解决链式思维推理中高令牌消耗问题的框架,通过利用推理轨迹中令牌的非均匀价值来实现。该方法利用归一化的对数概率信号区分携带决定性内容的核心令牌和冗余填充物。
- TokenProbe利用令牌级对数概率来识别并压缩低置信度的探索性令牌。
- 它引入了一种高效的GRPO目标,选择性移除冗余令牌以改善准确性与令牌效率的权衡。
- 实证结果显示,与基线相比,令牌使用量减少了76%,同时保持了推理质量。
- 在匹配的推理长度预算下,该方法优于Gemini-3.1-Pro等强大的基线模型。
这项工作表明,选择性压缩冗余令牌能带来帕累托改进,使模型在不牺牲性能的情况下实现更高的效率。