Googleは、AIコーディングエージェントが脆弱性のライフサイクル全体を実行できるようにするセキュリティレビュースキルスタックの非依存ツールキットであるMantisをオープンソース化した。このシステムにより、エージェントは疑わしい欠陥の特定、偽陽性の除去、サンドボックス内でのバグ再現、最小限のパッチ作成、そのパッチに対する再攻撃、および残余リスクの評価が可能になる。
Mantisはスタンドアロンスキャナーではなく既存のコーディングエージェント向けのスラッシュコマンドセットとして動作し、スーパーバイザーエージェントを通じて順次スキルをチェーンする。主要な段階には、バージョン管理履歴のマイニング、脅威モデルの構築、計画に対するファイルのスキャン、および重複の圧縮が含まれる。パイプラインはgVisorまたはVMを使用したサンドボックス内での再現、エクスプロイトチェーンの組み立て、修正の適用、人間が読み可能なレビューパケットの生成で終了する。
このツールキットは、モデルの信頼度ではなくサンドボックス内での再現とパッチの再攻撃に信頼を grounding することで、単純なAIコードスキャンにおける真陽性率が7%未満という問題に対処している。Googleによると、階層的要約ツリーによりトークンオーバーヘッドが85%以上削減された。Apache 2.0の下でローカルデプロイして評価可能だが、まだ本番環境での使用は推奨されていない。