研究者たちは、Chain-of-Thought推論を制限することが多い意味的誤解の Errors を解消することで、大規模言語モデルの数学文章題解決能力を向上させることを目的としたDUP(Deeply Understanding the Problems)を提案する。

  • DUPは、モデルが問題を深く理解し、より良い推論のために重要な情報を抽出することを促す。
  • この方法は、10の多様な推論ベンチマークにおいて一貫して同等手法を上回る。
  • DUPはzero-shot設定でGSM8Kベンチマークにおいて97.1%という新たな最良精度を達成した。

このアプローチは、計算やステップの欠落エラーだけでなく意味的理解に焦点を当てることで、LLMの推論性能を制限する主要な要因に対処する。