El artículo introduce una tesis de jlorraine que aborda los desafíos de aplicar la optimización de dos niveles o anidada a configuraciones de aprendizaje profundo a gran escala. Mientras que la optimización basada en gradientes típicamente actualiza un solo conjunto de parámetros, muchas aplicaciones requieren actualizar subconjuntos de parámetros en diferentes objetivos anidados unos dentro de otros.

  • El trabajo se centra en ejemplos motivadores como la optimización de hiperparámetros y las redes generativas adversarias.
  • Destaca que aplicar ingenuamente métodos clásicos a menudo falla al resolver estos problemas anidados a gran escala.
  • La tesis construye herramientas específicas diseñadas para hacer la optimización anidada escalable en contextos de aprendizaje profundo.