Induction Labs는 액션 레이블 없이 원시 영상에서 미래 프레임을 예측하여 데스크톱 환경을 시뮬레이션하고 게임을 플레이하는 방법을 학습하는 희소 106B-A5B 혼합 전문가(MoE) 트랜스포머인 Photon-1을 출시했습니다. 이 모델은 유한 스칼라 양자화를 사용하여 각 프레임을 960개의 이산 토큰으로 압축하며, 텍스트와 레이아웃 세부 사항을 보존하면서 기존 표현 방식보다 100배 이상 뛰어난 압축률을 달성합니다.
- Photon-1은 20억 개의 공개 영상에서 필터링된 코퍼스에서 추출한 5억 7천만 프레임(약 18년 치 영상)으로 사전 학습되었습니다.
- 다음 잠재 토큰 예측(next-latent-token-prediction) 목적 함수를 사용하여 약 30,000 H200 GPU시간과 4.4×10²² FLOPs가 필요한 훈련이 수행되었습니다.
- 내부 컴퓨터 사용 벤치마크에서 Photon-1은 Gemini 3.1 Flash-Lite보다 우수한 성능을 보이며 사전 학습 컴퓨팅 자원을 약 27배 적게 사용합니다.
- 35,000개 미만의 트래젝토리로 파인튜닝한 후, 체커에서는 기존 베이스라인을 압도하고 당구 물리학을 평균 절대 오차 0.47로 모델링합니다.
이 연구는 미래 상태 예측이 작업 완수를 위한 암시적 정책(implicit policy)을 학습시킨다는 것을 보여주지만, Induction Labs는 이는 가중치나 API가 제공되지 않는 연구 결과임을 명시했습니다.