A Cyberelf Labs apresentou um pequeno benchmark e um ranking público para o projeto Whetstone, projetado para facilitar a comparação de alterações em modelos em relação às versões anteriores.
A plataforma permite que os usuários executem modelos base e candidatos nas mesmas verificações para identificar ganhos ou regressões. Ela gera recibos que classificam os resultados como PASS, HOLD ou BLOCK, fornecendo uma maneira transparente de avaliar atualizações de IA antes do lançamento.