A Induction Labs lançou o Photon-1, um transformador misto de especialistas (mixture-of-experts) esparso de 106B-A5B que aprende a simular ambientes de desktop e jogar jogos prevendo quadros futuros a partir de vídeos brutos sem rótulos de ação. O modelo utiliza quantização escalar finita para comprimir cada quadro em 960 tokens discretos, alcançando uma compressão mais de 100 vezes melhor do que as representações existentes, enquanto preserva detalhes de texto e layout.

  • O Photon-1 foi pré-treinado com 575 milhões de quadros (aproximadamente 18 anos de vídeo) a partir de um corpus filtrado de 2 bilhões de vídeos públicos.
  • O treinamento exigiu aproximadamente 30.000 horas-GPU H200 e 4,4×10²² FLOPs, utilizando um objetivo de previsão do próximo token latente.
  • Em um benchmark interno de uso de computador, o Photon-1 supera o Gemini 3.1 Flash-Lite enquanto utiliza cerca de 27 vezes menos computação de pré-treinamento.
  • Após o ajuste fino em menos de 35.000 trajetórias, o modelo supera as linhas de base no jogo de damas e modela a física do bilhar com um erro absoluto médio de 0,47.

A pesquisa demonstra que prever estados futuros ensina uma política implícita para a conclusão de tarefas, embora a Induction Labs observe que este é um resultado de pesquisa sem pesos ou API disponíveis.