Google выпустила Gemini 3.7 Flash, гибридную модель рассуждений, предназначенную для программирования и агентных рабочих процессов, демонстрирующую способность управлять устройствами Android посредством визуального ввода. В статье подробно описывается, как модель анализирует необработанные скриншоты для планирования действий и выдачи точных координат, что позволяет реализовать интерактивные циклы управления устройством без опоры на деревья доступности.
- Цикл агента захватывает скриншоты через ADB, оценивает их с помощью Gemini 3.7 Flash и генерирует вызовы инструментов с нормализованными координатами 0–999.
- Скрипт на Python преобразует эти координаты в физические пиксели и выполняет действия, такие как нажатия и ввод текста.
- В тестовом случае модель успешно навигировала в Chrome, закрывала всплывающие окна и решала Wordle за два хода, читая цветовую обратную связь.
- Этот подход работает с нативными приложениями, webview и динамическими canvas-интерфейсами, где традиционные инструменты автоматизации терпят неудачу из-за отсутствия узлов доступности.
Репозиторий quickstart с открытым исходным кодом позволяет пользователям создавать инструменты для автоматизированного UI-тестирования, проверки пользовательских потоков и воспроизведения багов в исследовательском режиме, которые функционируют независимо от структуры DOM.