इंडक्शन लैब्स ने Photon-1 जारी किया है, जो एक विरल 106B-A5B मिक्सचर-ऑफ़-एक्सपर्ट्स ट्रान्सफॉर्मर है जो एक्शन लेबल्स के बिना कच्चे वीडियो से भविष्य के फ्रेम की भविष्यवाणी करके डेस्कटॉप वातावरणों का सिमुलेशन करने और गेम खेलना सीखता है। मॉडल प्रत्येक फ्रेम को 960 विविक्त टोकन में संकुचित करने के लिए परिमित स्केलर क्वांटीकरण का उपयोग करता है, मौजूदा प्रतिनिधित्वों की तुलना में पांच सौ गुना से अधिक बेहतर कंप्रेशन प्राप्त करते हुए भी टेक्स्ट और लेआउट विवरण को बनाए रखता है।

  • Photon-1 को 2 अरब सार्वजनिक वीडियो के एक फ़िल्टर्ड कॉर्पस से 575 मिलियन फ्रेम (लगभग 18 साल का वीडियो) पर प्रीट्रेन किया गया था।
  • प्रशिक्षण में अगले-लैटेंट-टोकन-प्रिडिक्शन उद्देश्य का उपयोग करते हुए लगभग 30,000 H200 GPU-घंटे और 4.4×10²² FLOPs की आवश्यकता थी।
  • एक आंतरिक कंप्यूटर यूज़ बेंचमार्क पर, Photon-1 ने Gemini 3.1 Flash-Lite को पछाड़ दिया, जबकि इसने लगभग 27 गुना कम प्रीट्रेनिंग कंप्यूट का उपयोग किया।
  • 35,000 से कम ट्रैजेक्टरी पर फाइनट्यूनिंग के बाद, मॉडल चेकर में बेलाइनों को हराता है और बिलियर्ड भौतिकी को 0.47 के माध्य निरपेक्ष त्रुटि के साथ मॉडल करता है।

शोध यह दर्शाता है कि भविष्य की स्थितियों की भविष्यवाणी कार्य पूर्ति के लिए एक अंतर्निहित नीति सिखाती है, हालांकि इंडक्शन लैब्स ने नोट किया है कि यह एक शोध परिणाम है जिसके पास कोई वजन या API उपलब्ध नहीं है।