Создатель Grand Coder отчитывается о внутренних исторических оценках, направленных на то, чтобы помочь способным ИИ-моделям рассуждать и работать более усердно, а не делать саму модель умнее. Многоуровневое инженерное исследование изначально запустило 96 изолированных выполнений, но исключило два семейства задач из-за недействительных скрытых требований, оставив 72 запуска для анализа.
- Базовый вариант прошёл 13 из 18 задач, в то время как три конфигурации Grand Coder прошли 16/18, 16/18 и 15/18 соответственно.
- Прирост был сосредоточен в двух оставшихся семействах задач, тогда как другие четыре уже проходили при любых условиях.
- Другие оценки показали насыщенные тесты без разницы или видимые победы, которые исчезли после корректировки оценок.
- Оценки слепых рецензий улучшились в одном исследовании сборки, но скорректированные поведенческие тесты не показали преимущества при более высокой стоимости.
Автор приходит к выводу, что Grand Coder обеспечил конкретные измеримые преимущества, полезные для текущей работы, подчёркивая необходимость отделять впечатления рецензентов от фактических проверок поведения и затрат. Реализация остаётся закрытой, что ограничивает независимую проверку этих результатов.