著者は、結果の透明性と比較可能性を向上させるために、Vision-Language-Action (VLA) 攻撃論文のための報告基準のセットを提案しています。この提案は、現在の文献が本質的なベースラインデータと統計的コンテキストを欠いていることが多く、攻撃の有効性に関する曖昧な主張につながっていると論じています。
主な要件には以下が含まれます:
- 引き算なしで、同じタスクとシードにおける一致したベニグン制御レートを報告する。
- 正規近似の代わりに、小サンプルサイズ(例:n=50)の成功率に対してウィルソン区間を使用する。
- 転移主張を明確にするために、ターゲットがスタブ、ローカルチェックポイント、またはホストされたモデルのいずれであったかを明示的に記載する。
- 失敗カウントに文脈を与えるために、検索ベースの攻撃の結果テーブルにクエリ予算を含める。
著者は、これらの基準が適切かどうかについてコミュニティからのフィードバックを求め、他のサブフィールドがすでに同様の報告慣行を採用しているかどうかを尋ねています。