Google ने Gemini 3.7 Flash लॉन्च किया है, जो कोडिंग और एजेंटिक वर्कफ़्लो के लिए डिज़ाइन किया गया एक हाइब्रिड रीजनिंग मॉडल है, जो दृश्य इनपुट के माध्यम से Android उपकरणों को नियंत्रित करने की अपनी क्षमता का प्रदर्शन करता है। लेख विस्तार से बताता है कि मॉडल कच्चे स्क्रीनशॉट का निरीक्षण कैसे करता है, कार्रवाई की योजना बनाता है और सटीक निर्देशांक उत्पन्न करता है, जिससे एक्सेसिबिलिटी ट्री पर निर्भर किए बिना इंटरैक्टिव डिवाइस कंट्रोल लूप संभव होता है।
- एजेंट लूप ADB के माध्यम से स्क्रीनशॉट कैप्चर करता है, उन्हें Gemini 3.7 Flash के साथ मूल्यांकन करता है, और सामान्यीकृत 0–999 निर्देशांक के साथ टूल कॉल उत्पन्न करता है।
- एक Python स्क्रिप्ट इन निर्देशांक को भौतिक पिक्सेल में मैप करती है और टैप और टेक्स्ट इनपुट जैसी कार्रवाई को निष्पादित करती है।
- एक परीक्षण मामले में, मॉडल ने Chrome में सफलतापूर्वक नेविगेशन किया, पॉपअप को साफ़ किया, और रंग-कोडेड फीडबैक पढ़कर दो अनुमानों में Wordle हल किया।
- यह दृष्टिकोण नेटिव ऐप्स, वेबव्यूज़ और गतिशील कैनवास इंटरफ़ेस पर काम करता है जहाँ पारंपरिक ऑटोमेशन टूल एक्सेसिबिलिटी नोड्स की अनुपस्थिति के कारण विफल हो जाते हैं।
ओपन-सोर्स क्विकस्टार्ट रिपॉजिटरी उपयोगकर्ताओं को स्वचालित UI टेस्टिंग, यूज़र फ़्लो सत्यापन और एक्सप्लोरेटरी बग रीप्रोडक्शन टूल्स बनाने की अनुमति देती है जो अंतर्निहित DOM संरचनाओं से स्वतंत्र रूप से कार्य करते हैं।