Induction Labsは、アクションラベルなしで生動画から未来のフレームを予測することでデスクトップ環境のシミュレーションやゲームプレイを学ぶ、スパースな106B-A5B Mixture-of-ExpertsトランスフォーマーであるPhoton-1をリリースした。このモデルは有限スカラー量子化を用いて各フレームを960個の離散トークンに圧縮し、テキストやレイアウトの詳細を保持しつつ、既存の表現よりも100倍以上の圧縮率を実現している。
- Photon-1は、20億本の公開動画からフィルタリングされたコーパスに含まれる5億7500万フレーム(約18年分の動画)で事前学習を行った。
- 次期潜在トークン予測を目的関数として用い、約30,000 H200 GPU時間と4.4×10²² FLOPsのトレーニングが必要だった。
- 内部のコンピュータ操作ベンチマークにおいて、Photon-1はGemini 3.1 Flash-Liteを上回り、事前学習計算量は約27分の1で済んだ。
- 3万5000本未満の軌道データでファインチューニングした後、チェッカーではベースラインを上回り、ビリヤードの物理法則を平均絶対誤差0.47でモデル化した。
本研究は、未来状態の予測がタスク完了のための暗黙的ポリシーを教示することを示しているが、Induction Labsはこれは重みやAPIが利用できない研究結果であると注記している。