Grand Coderの作成者は、モデル自体をより賢くするのではなく、能力のあるAIモデルがより慎重に推論し、勤勉に作業できるようにすることを目的とした内部の歴史的評価について報告している。段階的なエンジニアリング研究では当初96の孤立した実行が行われたが、無効な隠れた要件のため2つのタスクファミリーが除外され、分析には72の実行が残された。

  • ベースラインは18タスク中13をパスしたが、3つのGrand Coder構成はそれぞれ16/18、16/18、15/18をパスした。
  • 改善は保持された2つのタスクファミリーに集中しており、他の4つはあらゆる条件で既にパスしていた。
  • 他の評価では、テストが飽和状態であり、差がないか、スコア補正後に消えた見かけ上の勝利が見られた。
  • ブラインドレビューのスコアは1つのビルド研究で改善したが、補正された行動テストでは高いコストに対して優位性は見られなかった。

著者は、Grand Coderが継続的な作業に有用な特定の測定可能な利益を生み出したと結論付け、レビュアーの印象と実際の行動チェックおよびコストを分離する必要性を強調している。実装は非公開であり、これらの発見の独立した検証を制限している。