Induction Labs ha lanzado Photon-1, un transformador de mezcla de expertos disperso de 106B-A5B que aprende a simular entornos de escritorio y jugar videojuegos prediciendo fotogramas futuros a partir de video sin etiquetas de acción. El modelo utiliza cuantización escalar finita para comprimir cada fotograma en 960 tokens discretos, logrando una compresión más de 100 veces mejor que las representaciones existentes mientras preserva los detalles de texto y diseño.

  • Photon-1 fue preentrenado con 575 millones de fotogramas (aproximadamente 18 años de video) a partir de un corpus filtrado de 2 mil millones de videos públicos.
  • El entrenamiento requirió aproximadamente 30.000 horas-GPU H200 y 4,4×10²² FLOPs, utilizando un objetivo de predicción del siguiente token latente.
  • En una prueba interna de uso de computadora, Photon-1 supera a Gemini 3.1 Flash-Lite mientras utiliza aproximadamente 27 veces menos cómputo de preentrenamiento.
  • Después del ajuste fino con menos de 35.000 trayectorias, el modelo supera las líneas base en damas y modela la física de billar con un error absoluto medio de 0,47.

La investigación demuestra que predecir estados futuros enseña una política implícita para la finalización de tareas, aunque Induction Labs señala que este es un resultado de investigación sin pesos ni API disponibles.