Induction Labs发布了Photon-1,这是一种稀疏的106B-A5B混合专家Transformer,它通过从原始视频中预测未来帧(无需动作标签)来学习模拟桌面环境并玩游戏。该模型使用有限标量量化技术将每一帧压缩为960个离散token,在保留文本和布局细节的同时,实现了比现有表示方法高100多倍的压缩率。

  • Photon-1在过滤后的20亿个公共视频语料库中的5.75亿帧(约18年视频)上进行预训练。
  • 训练需要大约30,000个H200 GPU小时和4.4×10²²次浮点运算,采用下一个潜在token预测目标。
  • 在内部计算机使用基准测试中,Photon-1的表现优于Gemini 3.1 Flash-Lite,同时预训练计算量减少了约27倍。
  • 在少于35,000条轨迹上进行微调后,该模型在跳棋任务中超越了基线,并以0.47的平均绝对误差模拟了台球物理。

这项研究表明,预测未来状态能够教会隐式策略以完成任务,尽管Induction Labs指出这是一个研究成果,目前不提供权重或API。