연구자들은 ALTK-Evolve 시스템 내에 "일관성 가이드라인"을 도입했으며, 이는 표준 평균 정확도 지표가 종종 숨기는 LLM 에이전트 성능의 변동성을 해결하기 위해 설계된 새로운 메커니즘입니다. 뒤집어질 가능성이 높은 의사결정 지점을 식별하고 안정화함으로써 이 접근 방식은 전반적인 능력을 희생하지 않고 작업 성공의 일관성을 크게 향상시킵니다.

  • 일관성 분석기는 단일 기록된 궤적을 k=5개의 완성으로 재샘플링하여 "뒤집어질 가능성이 높은" 단계를 감지하며, 정답이나 끝에서 끝까지의 재실행이 필요하지 않습니다.
  • GPT-4.1을 사용하는 ReAct 에이전트와 함께 AppWorld test_normal에서 일관성 가이드라인은 일관성 격차(Mean@5에서 Pass^5를 뺀 값)를 24.4%p에서 12.0%p로 줄였습니다.
  • 전체 Pass^5는 53.0%에서 69.0%로 증가했고, Mean@5는 77.4%에서 81.0%로 약간 상승하여 평균 정확도를 유지했습니다.
  • 이 방법은 유사한 작업으로 일반화되어 Pass^5를 13.0%p 향상시켰으며, gpt-oss-120b와 같은 약한 모델에서도 전이 가능한 이점을 보여줍니다.

이번 연구는 일관성이 능력과 직교하는 축임을 강조하며, 개발자들이 프로덕션 환경에서 에이전트 신뢰도를 더 잘 평가하기 위해 Mean@k와 함께 Pass^k를 보고할 것을 촉구합니다.