Google Cloud AI Research는 UNC-Chapel Hill, 스탠퍼드 대학교, 세인트루이스 워싱턴 대학교와 협력하여 RRSI(정규화된 재귀적 자기 개선)를 오픈소스로 공개했습니다. 이 프레임워크는 모델 가중치를 변경하지 않고도 LLM 에이전트가 프롬프트, 도구, 메모리, 제어 흐름 및 하위 에이전트를 포함한 자체 하니스를 재작성할 수 있게 합니다.

  • RRSI는 소멸 편집 예산, 증거 인식 크레딧 로깅, 벤치마크 특정 논리를 거부하는 누출 비평가와 같은 정규화를 통해 개선 루프를 제약하여 과적합을 해결합니다.
  • 시스템은 노이즈 조정 바닥값과 비용 규칙을 사용하여 이득이 실제적이고 효율적임을 보장하며, 더 이상 가치를 생성하지 않는 구성 요소를 가지칩니다.
  • Terminal-Bench 2.1에서 점수가 74.2%에서 80.2%로 상승했으며, SWE-bench Verified는 홀드아웃 분할에서 82.0%에서 83.8%로 개선되었습니다.
  • 분포 밖 벤치마크에서는 JobBench에서 +4.7점, GDPval에서 +3.5점, APEX-Agents에서 +3.7점의 이득을 보였습니다.
  • 프레임워크는 정규화되지 않은 진화 방법과 비교하여 정책 토큰 사용량을 약 30-36% 줄입니다.

저자들은 이것이 명시적으로 최적화되지 않은 작업에 걸쳐 일반화를 유지하면서 AI 에이전트가 자체 운영 구조를 개선할 수 있게 하기 때문에 중요하다고 간주합니다.