Исследователи представляют AIDE^2 — систему, реализующую цикл рекурсивного самосовершенствования для передового агента ИИ, занимающегося научными исследованиями, путём оптимизации его собственного кода. Система предлагает изменения во внутренней логике, оценивает изменённые версии на задачах ИИ-исследований и разработок (R&D) и сохраняет только те обновления, которые показывают наилучшие результаты на скрытых оценках.

  • В автономном 8-дневном запуске AIDE^2 нашёл семь последовательных улучшений, включая новые политики поиска и механизмы памяти для сжатия контекста.
  • Эти улучшения обобщились на четыре отложенных бенчмарка, охватывающих машинное обучение в инженерии, проектирование эвристических алгоритмов и физику-основанное прогнозирование погоды.
  • На всех четырёх бенчмарках самый сильный обнаруженный агент соответствовал или превосходил производственного исследовательского агента, спроектированного человеком, который занимает одно из сильнейших мест в FML-Bench.
  • На отдельной отложенной группе задач обнаруженные агенты продемонстрировали снижение «хакерства» на вознаграждении: показатель упал с 55% до 32%, что на семь процентных пунктов ниже, чем у спроектированного человеком агента.

Эти результаты демонстрируют, что агент ИИ для научных исследований может повышать собственную эффективность исследований посредством рекурсивного самосовершенствования и что эти улучшения переносятся на задачи и области, с которыми цикл никогда не сталкивался.