Google a lancé Gemini 3.7 Flash, un modèle de raisonnement hybride conçu pour la programmation et les workflows agents, démontrant sa capacité à contrôler des appareils Android via une entrée visuelle. L'article détaille comment le modèle inspecte des captures d'écran brutes pour planifier des actions et émettre des coordonnées précises, permettant des boucles de contrôle interactif de l'appareil sans dépendre des arbres d'accessibilité.

  • La boucle agent capture des captures d'écran via ADB, les évalue avec Gemini 3.7 Flash, et émet des appels d'outils avec des coordonnées normalisées de 0 à 999.
  • Un script Python mappe ces coordonnées aux pixels physiques et exécute des actions comme les tapotements et la saisie de texte.
  • Dans un cas de test, le modèle a réussi à naviguer dans Chrome, à effacer les popups et à résoudre Wordle en deux essais en lisant les retours codés par couleur.
  • Cette approche fonctionne sur les applications natives, les webviews et les interfaces de canevas dynamiques où les outils d'automatisation traditionnels échouent en raison de l'absence de nœuds d'accessibilité.

Le dépôt quickstart open-source permet aux utilisateurs de créer des outils de test UI automatisé, de vérification de flux utilisateur et de reproduction exploratoire de bugs qui fonctionnent indépendamment des structures DOM sous-jacentes.