Google 推出了 Gemini 3.7 Flash,这是一种专为编码和智能体工作流设计的混合推理模型,展示了其通过视觉输入控制 Android 设备的能力。文章详细介绍了该模型如何检查原始截图以规划动作并输出精确坐标,从而实现无需依赖无障碍树的可交互设备控制循环。

  • 智能体循环通过 ADB 捕获截图,使用 Gemini 3.7 Flash 进行评估,并输出带有归一化 0–999 坐标的工具调用。
  • Python 脚本将这些坐标映射到物理像素,并执行点击和文本输入等动作。
  • 在一个测试案例中,该模型成功导航了 Chrome,清除了弹窗,并通过读取颜色编码的反馈在两次猜测内解出了 Wordle。
  • 这种方法适用于原生应用、webview 和动态画布界面,在这些场景中,传统自动化工具因缺少无障碍节点而失效。

开源的快速入门仓库允许用户构建自动化 UI 测试、用户流程验证以及探索性错误复现工具,这些工具的功能不受底层 DOM 结构的影响。