Новая статья исследует использование фундаментальных больших языковых моделей (LLM) для автоматизации гиперпараметрической оптимизации (HPO), процесса, который обычно полагается на ручные подходы в условиях ограниченного бюджета. Авторы разработали методологию, в которой LLM предлагают конфигурации гиперпараметров на основе описаний набора данных и модели, которые затем итеративно уточняются в соответствии с производительностью модели.

  • Эмпирические оценки на стандартных бенчмарках показывают, что при ограниченных бюджетах поиска LLM могут соответствовать или превосходить традиционные методы HPO, такие как байесовская оптимизация, для различных моделей.
  • Подход рассматривает код, определяющий модель, как гиперпараметр, позволяя LLM выводить его напрямую для большей гибкости по сравнению с существующими подходами HPO.

Эта работа предполагает, что LLM могут служить эффективной альтернативой традиционным методам оптимизации при ограниченных вычислительных ресурсах.