研究人员提出了DUP(Deeply Understanding the Problems),这是一种旨在通过解决常限制Chain-of-Thought推理的语义误解错误,来提升大型语言模型解答数学应用题能力的方案。

  • DUP鼓励模型深入理解问题并提取关键信息以进行更好的推理。
  • 该方法在10个多样化的推理基准测试中持续优于其他方法。
  • DUP在zero-shot设置下的GSM8K基准测试中取得了97.1%的最新最高准确率。

这种方法通过关注语义理解而非仅仅是计算或步骤遗漏错误,解决了限制LLM推理性能的一个主要因素。