本文介绍了一篇由 jlorraine 撰写的论文,该论文解决了将双层或嵌套优化应用于大规模深度学习设置时面临的挑战。虽然基于梯度的优化通常更新一组参数,但许多应用需要在彼此嵌套的不同目标上更新参数的子集。

  • 这项工作侧重于动机示例,如超参数优化和生成对抗网络。
  • 它强调在规模上解决这些嵌套问题时,天真地应用经典方法通常会失败。
  • 该论文构建了专为深度学习环境设计的特定工具,以使嵌套优化具有可扩展性。