Googleは、コーディングやエージェントワークフロー向けに設計されたハイブリッド推論モデルであるGemini 3.7 Flashをリリースし、視覚入力を通じてAndroidデバイスを制御する能力を実証した。本記事では、モデルが生のスクリーンショットを検査してアクションを計画し、正確な座標を出力することで、アクセシビリティツリーに依存せずにインタラクティブなデバイス制御ループを実現する方法について詳述している。
- エージェントループはADB経由でスクリーンショットをキャプチャし、Gemini 3.7 Flashで評価して、正規化された0–999の座標を持つツール呼び出しを出力する。
- Pythonスクリプトはこれらの座標を物理ピクセルにマッピングし、タップやテキスト入力などのアクションを実行する。
- テストケースでは、モデルはChromeでのナビゲーション、ポップアップの消去、そして色付きフィードバックを読み取って2回の試行でWordleを解決することに成功した。
- このアプローチは、従来の自動化ツールがアクセシビリティノードの欠如により機能しないネイティブアプリ、webview、動的キャンバスインターフェース全体で動作する。
オープンソースのクイックスタートリポジトリにより、ユーザーは基盤となるDOM構造に関係なく機能する自動UIテスト、ユーザーフロー検証、探索的バグ再現ツールを構築できる。