Un nuevo artículo explora el uso de modelos de lenguaje grandes fundamentales (LLM) para automatizar la optimización de hiperparámetros (HPO), un proceso que normalmente depende de enfoques manuales en configuraciones con presupuesto limitado. Los autores desarrollaron una metodología donde los LLM sugieren configuraciones de hiperparámetros basadas en descripciones del conjunto de datos y del modelo, las cuales se refinan iterativamente según el rendimiento del modelo.

  • Las evaluaciones empíricas en benchmarks estándar muestran que, dentro de presupuestos de búsqueda restringidos, los LLM pueden igualar o superar a los métodos tradicionales de HPO como la optimización bayesiana en diferentes modelos.
  • El enfoque trata el código que especifica el modelo como un hiperparámetro, permitiendo que el LLM lo genere directamente para una mayor flexibilidad que los enfoques de HPO existentes.

Este trabajo sugiere que los LLM pueden servir como alternativas efectivas a las técnicas de optimización tradicionales cuando los recursos computacionales son limitados.