Cyberelf Labs ha presentado un pequeño benchmark y una lista pública para el proyecto Whetstone, diseñado para facilitar la comparación de cambios en modelos frente a versiones anteriores.
La plataforma permite a los usuarios ejecutar modelos base y candidatos en las mismas pruebas para identificar ganancias o regresiones. Genera recibos que clasifican los resultados como PASS, HOLD o BLOCK, proporcionando una forma transparente de evaluar las actualizaciones de IA antes de su lanzamiento.