Cyberelf Labs telah memperkenalkan benchmark kecil dan papan peringkat publik untuk proyek Whetstone, yang dirancang untuk memfasilitasi perbandingan perubahan model terhadap versi sebelumnya.

Platform ini memungkinkan pengguna menjalankan model baseline dan kandidat pada pemeriksaan yang identik untuk mengidentifikasi peningkatan atau regresi. Platform ini menghasilkan tanda terima yang mengklasifikasikan hasil sebagai PASS, HOLD, atau BLOCK, memberikan cara yang transparan untuk mengevaluasi pembaruan AI sebelum pengiriman.