Google은 코딩 및 에이전트 워크플로우에 설계된 하이브리드 추론 모델인 Gemini 3.7 Flash를 출시했으며, 시각적 입력을 통해 Android 기기를 제어하는 능력을 입증했습니다. 이 기사는 모델이 원시 스크린샷을 검사하여 행동을 계획하고 정확한 좌표를 생성하며, 접근성 트리(Accessibility trees)에 의존하지 않고 상호작용형 기기 제어 루프를 가능하게 하는 방법을 상세히 설명합니다.

  • 에이전트 루프는 ADB를 통해 스크린샷을 캡처하고 Gemini 3.7 Flash로 이를 평가한 후 정규화된 0–999 좌표와 함께 도구 호출을 생성합니다.
  • Python 스크립트는 이러한 좌표를 물리적 픽셀에 매핑하여 탭 및 텍스트 입력과 같은 동작을 실행합니다.
  • 테스트 사례에서 모델은 색상 코딩된 피드백을 읽음으로써 Chrome 탐색, 팝업 닫기, 그리고 두 번의 추측으로 Wordle를 해결하는 데 성공했습니다.
  • 이 접근 방식은 전통적인 자동화 도구가 누락된 접근성 노드로 인해 실패하는 네이티브 앱, 웹뷰 및 동적 캔버스 인터페이스 전반에서 작동합니다.

오픈소스 빠른 시작 저장소를 통해 사용자는 기본 DOM 구조와 무관하게 기능하는 자동화된 UI 테스트, 사용자 흐름 검증 및 탐색형 버그 재현 도구를 구축할 수 있습니다.