IBM a publié Granite 4.2, une famille de grands modèles de langage (LLM) de raisonnement denses et uniquement décodeur aux tailles de 3B, 8B et 30B. Ces modèles sont pré-entraînés à partir de zéro sur environ 15 billions de tokens et disposent d'une fenêtre de contexte étendue à 512K tokens.
- Le pipeline d'entraînement inclut un ajustement fin supervisé sur des données de chaîne de pensée et de trajectoire agéntique, suivi d'un apprentissage par renforcement multi-étapes.
- Les modèles 8B et 30B subissent un RL agéntique pour apprendre l'utilisation d'outils dans des environnements sandboxés réels, y compris l'ingénierie logicielle et la recherche web.
- Tous les modèles prennent en charge l'appel natif d'outils via un endpoint compatible OpenAI et incluent un interrupteur pour les modes de réflexion ou non-réflexion.
- Les modèles sont publiés sous la licence Apache 2.0.