O criador do Grand Coder relata sobre avaliações históricas internas destinadas a ajudar modelos de IA capazes a raciocinar e trabalhar com mais diligência, em vez de tornar o modelo em si mais inteligente. Um estudo de engenharia em camadas inicialmente executou 96 execuções isoladas, mas excluiu duas famílias de tarefas devido a requisitos ocultos inválidos, restando 72 execuções para análise.
- A linha de base passou 13 das 18 tarefas, enquanto três configurações do Grand Coder passaram 16/18, 16/18 e 15/18 respectivamente.
- Os ganhos foram concentrados em duas famílias de tarefas retidas, com as outras quatro já passando em todas as condições.
- Outras avaliações mostraram testes saturados sem diferença ou vitórias aparentes que desapareceram após correções de pontuação.
- As pontuações de revisão cega melhoraram em um estudo de compilação, mas os testes comportamentais corrigidos não mostraram vantagem com custo mais elevado.
O autor conclui que o Grand Coder produziu benefícios mensuráveis específicos úteis para o trabalho contínuo, enfatizando a necessidade de separar as impressões dos revisores das verificações comportamentais reais e dos custos. A implementação permanece privada, limitando a verificação independente dessas descobertas.