Thinking Machines Lab a publié Inkling-Small, un modèle Mixture-of-Experts à poids ouverts avec 276 milliards de paramètres au total et 12 milliards de paramètres actifs. Le modèle est entraîné pour raisonner nativement sur le texte, les images et l'audio, avec une fenêtre de contexte de 1M de tokens et un effort de réflexion ajustable.

  • Les poids sont disponibles sous licence Apache 2.0 sur Hugging Face, avec BF16 nécessitant 600 GB de VRAM et la quantification NVFP4 réduisant l'exigence à 180 GB.
  • L'architecture utilise 42 couches de décodeur où chaque token est routé vers 6 des 256 experts plus 2 experts partagés, traitant les images via des patches et l'audio sous forme de spectrogrammes dMel.
  • Inkling-Small dépasse son modèle professeur plus grand Inkling sur les benchmarks de raisonnement comme Humanity's Last Exam (31.6% vs 29.7%) et SWE-bench Verified (80.2% vs 77.6%).
  • La rappel factuel a régressé de manière significative, avec SimpleQA Verified tombant à 20.6% contre 43.9% pour Inkling, tandis que les scores multimodaux sont restés proches du modèle plus grand.

La publication permet aux startups et aux entreprises d'héberger en auto un modèle de pointe sur des configurations à un ou deux GPU, prenant en charge des charges de travail telles que les agents de codage, l'automatisation de terminal et l'analyse des centres d'appels.