Cyberelf Labs는 이전 버전 대비 모델 변경 사항을 비교하기 쉽게 하기 위해 설계된 Whetstone 프로젝트용 소규모 벤치마크와 공개 리더보드를 선보였습니다.

이 플랫폼을 사용하면 사용자는 동일한 검사에서 기본 모델과 후보 모델을 실행하여 성능 향상 또는 퇴보를 식별할 수 있습니다. PASS, HOLD, BLOCK으로 결과를 분류하는 영수증을 생성하여 출시 전 AI 업데이트를 투명하게 평가할 수 있는 방법을 제공합니다.