Induction Labs выпустила Photon-1, разреженную смесь экспертов (mixture-of-experts) трансформера с 106B-A5B параметрами, которая учится симулировать рабочие среды и играть в игры, предсказывая будущие кадры из необработанных видео без меток действий. Модель использует конечную скалярную квантование для сжатия каждого кадра до 960 дискретных токенов, достигая более чем в 100 раз лучшего сжатия по сравнению с существующими представлениями, сохраняя при этом детали текста и макета.
- Photon-1 была предварительно обучена на 575 миллионах кадров (примерно 18 лет видео) из отфильтрованного корпуса из 2 миллиардов публичных видео.
- Обучение потребовало примерно 30 000 GPU-часов H200 и 4,4×10²² FLOPs с использованием задачи предсказания следующего латентного токена.
- На внутреннем бенчмарке использования компьютера Photon-1 превосходит Gemini 3.1 Flash-Lite, используя примерно в 27 раз меньше вычислений для предварительного обучения.
- После дообучения на менее чем 35 000 траекториях модель превосходит базовые варианты в шашках и моделирует физику бильярда со средней абсолютной ошибкой 0,47.
Исследование демонстрирует, что предсказание будущих состояний обучает неявную политику для выполнения задач, хотя Induction Labs отмечает, что это исследовательский результат, без доступных весов или API.