Un nouvel article explore l'utilisation de grands modèles linguistiques fondamentaux (LLM) pour automatiser l'optimisation des hyperparamètres (HPO), un processus qui repose généralement sur des approches manuelles dans des configurations à budget limité. Les auteurs ont développé une méthodologie où les LLM suggèrent des configurations d'hyperparamètres basées sur les descriptions du jeu de données et du modèle, qui sont ensuite affinées itérativement en fonction des performances du modèle.
- Les évaluations empiriques sur des benchmarks standard montrent que, dans des budgets de recherche contraints, les LLM peuvent égaler ou surpasser les méthodes HPO traditionnelles comme l'optimisation bayésienne sur différents modèles.
- L'approche traite le code spécifiant le modèle comme un hyperparamètre, permettant au LLM de le générer directement pour une plus grande flexibilité que les approches HPO existantes.
Ce travail suggère que les LLM peuvent servir d'alternatives efficaces aux techniques d'optimisation traditionnelles lorsque les ressources informatiques sont limitées.