OpenAI a publié Open-1B, un modèle de langage entraîné selon un régime où chaque opération pendant l'entraînement est reproductible indépendamment sur du matériel hétérogène standard avec une certitude bit à bit. Cette approche traite des problèmes de reproductibilité inhérents aux modèles open-source en imposant un ordre défini aux sources de non-déterminisme, telles que les réductions de noyaux GPU et l'ordre des lots de données.
La publication inclut l'ensemble de données complet de pré-entraînement, chaque checkpoint intermédiaire, la base de code d'entraînement et un harnais d'audit permettant aux auditeurs indépendants de certifier des étapes individuelles de l'exécution distribuée de l'entraînement.
Cette nouvelle couche de transparence du modèle vise à éliminer les données non divulguées, les biais injectés ou les backdoors en permettant aux utilisateurs de vérifier qu'un checkpoint publié a été réellement produit en utilisant la recette d'entraînement déclarée.