Induction Labs a publié Photon-1, un transformateur à mélange d'experts (MoE) épars de 106B-A5B qui apprend à simuler des environnements de bureau et à jouer à des jeux en prédisant les futures images à partir de vidéos brutes sans étiquettes d'action. Le modèle utilise la quantification scalaire finie pour compresser chaque image en 960 jetons discrets, atteignant une compression plus de 100 fois meilleure que les représentations existantes tout en préservant les détails du texte et de la mise en page.
- Photon-1 a été préentraîné sur 575 millions d'images (environ 18 ans de vidéos) à partir d'un corpus filtré de 2 milliards de vidéos publiques.
- L'entraînement a nécessité environ 30 000 heures-GPU H200 et 4,4×10²² FLOPs, en utilisant un objectif de prédiction du prochain jetot latent.
- Sur un benchmark interne d'utilisation d'ordinateur, Photon-1 surpasse Gemini 3.1 Flash-Lite tout en utilisant environ 27 fois moins de calculs de préentraînement.
- Après un affinage (finetuning) sur moins de 35 000 trajectoires, le modèle bat les références aux dames et modélise la physique des billards avec une erreur absolue moyenne de 0,47.
La recherche démontre que la prédiction des futurs états enseigne une politique implicite pour l'accomplissement des tâches, bien qu'Induction Labs note qu'il s'agit d'un résultat de recherche sans poids ni API disponibles.