Google ha lanzado Gemini 3.7 Flash, un modelo de razonamiento híbrido diseñado para codificación y flujos de trabajo agénticos, demostrando su capacidad para controlar dispositivos Android a través de entrada visual. El artículo detalla cómo el modelo inspecciona capturas de pantalla en bruto para planificar acciones y emitir coordenadas precisas, permitiendo bucles de control interactivo del dispositivo sin depender de árboles de accesibilidad.
- El bucle del agente captura capturas de pantalla mediante ADB, las evalúa con Gemini 3.7 Flash y emite llamadas a herramientas con coordenadas normalizadas de 0–999.
- Un script de Python mapea estas coordenadas a píxeles físicos y ejecuta acciones como toques e introducción de texto.
- En un caso de prueba, el modelo navegó exitosamente por Chrome, eliminó ventanas emergentes y resolvió Wordle en dos intentos al leer retroalimentación codificada por colores.
- Este enfoque funciona en aplicaciones nativas, webviews e interfaces de canvas dinámicas donde las herramientas de automatización tradicionales fallan debido a la falta de nodos de accesibilidad.
El repositorio quickstart de código abierto permite a los usuarios construir herramientas de prueba automática de UI, verificación de flujos de usuario y reproducción exploratoria de errores que funcionan independientemente de las estructuras DOM subyacentes.