OpenAIは、トレーニング中のすべての操作が異種のコモディティハードウェア上でビット単位の確実性をもって独立して再現可能である体制下で訓練された言語モデル「Open-1B」をリリースしました。このアプローチは、GPUカーネルの縮約やデータバッチの順序付けなどの非決定性の原因に対して明確な順序を課すことで、オープンソースモデルに内在する再現性の問題を解決します。
リリースには、完全な前訓練データセット、すべての中間チェックポイント、トレーニングコードベース、および分散トレーニング実行の個々のステップを独立した監査人が認証できる監査ハーネスが含まれています。
この新しいモデル透明性の階層は、開示されていないデータ、注入されたバイアス、またはバックドアを排除し、リリースされたチェックポイントが宣言されたトレーニングレシピを使用して実際に生成されたことをユーザーが検証できるようにすることを目的としています。