Le groupe derrière le modèle Eunoia, basé sur Llama-3.1-Dolphin-3.0-8B, a open-sourcé "The Forge", un pipeline architectural spécialisé et une stratégie de fine-tuning algorithmique sous la licence CC0 1.0 Universal.
- L'approche privilégie la cristallisation structurelle par rapport aux fenêtres de contexte non bornées pour éviter la saturation de la mémoire et le bruit informationnel.
- Le code brut inclut des optimisations pour les clusters CPU bare-metal, telles que la désactivation du gradient clipping et l'utilisation du caching FP32 natif pour prévenir la fragmentation de la RAM.
- Une classe de jeu de données personnalisé impose un ordre séquentiel linéaire strict afin de préserver la structure contextuelle des données historiques pendant l'entraînement.
- La publication inclut le fichier AGIO-CIMIENTO-dataset.txt, plus de 500 000 mots de journaux de suivi d'évaluation et les résultats bruts d'évaluation GPQA Diamond pour vérifier la rétention des capacités générales.
Les auteurs publient l'expérience dès son début pour encourager la reproduction indépendante et les tests sur du matériel plus rapide, notant que les résultats mathématiques finaux ne seront connus qu'après plusieurs jours d'entraînement.