El creador de Grand Coder informa sobre evaluaciones históricas internas destinadas a ayudar a modelos de IA capaces a razonar y trabajar con mayor diligencia, en lugar de hacer que el modelo sea más inteligente. Un estudio de ingeniería por niveles ejecutó inicialmente 96 corridas aisladas, pero excluyó dos familias de tareas debido a requisitos ocultos no válidos, dejando 72 corridas para el análisis.

  • La línea base aprobó 13 de 18 tareas, mientras que tres configuraciones de Grand Coder aprobaron 16/18, 16/18 y 15/18 respectivamente.
  • Las ganancias se concentraron en dos familias de tareas retenidas, con las otras cuatro ya aprobadas en todas las condiciones.
  • Otras evaluaciones mostraron pruebas saturadas sin diferencia o victorias aparentes que desaparecieron después de las correcciones de puntuación.
  • Las puntuaciones de revisión a ciegas mejoraron en un estudio de compilación, pero las pruebas de comportamiento corregidas no mostraron ventaja a mayor costo.

El autor concluye que Grand Coder ha producido beneficios específicos y medibles útiles para el trabajo en curso, enfatizando la necesidad de separar las impresiones del revisor de las verificaciones reales de comportamiento y costos. La implementación sigue siendo privada, lo que limita la verificación independiente de estos hallazgos.