Cyberelf Labs представила небольшой бенчмарк и публичный рейтинг для проекта Whetstone, предназначенный для упрощения сравнения изменений моделей с предыдущими версиями.

Платформа позволяет пользователям запускать базовые и тестовые модели на одинаковых проверках, чтобы выявить улучшения или регрессии. Она формирует квитанции, классифицирующие результаты как PASS, HOLD или BLOCK, обеспечивая прозрачный способ оценки обновлений ИИ перед их выпуском.