A OpenAI lançou o Open-1B, um modelo de linguagem treinado sob um regime onde cada operação durante o treinamento é reproduzível independentemente em hardware comercial heterogêneo com certeza bit a bit. Esta abordagem aborda os problemas de reprodutibilidade inerentes aos modelos de código aberto ao impor uma ordem definida sobre as fontes de não determinismo, como reduções de kernels de GPU e ordenação de lotes de dados.

O lançamento inclui o conjunto de dados completo de pré-treinamento, cada checkpoint intermediário, a base de código do treinamento e um kit de auditoria que permite auditores independentes certificar etapas individuais da execução distribuída do treinamento.

Esta nova camada de transparência do modelo visa eliminar dados não divulgados, vieses injetados ou backdoors, permitindo que os usuários verifiquem se um checkpoint lançado foi realmente produzido usando a receita de treinamento declarada.