저자는 결과의 투명성과 비교 가능성을 개선하기 위해 Vision-Language-Action (VLA) 공격 논문에 대한 보고 표준 세트를 제안합니다. 이 제안은 현재 문헌이 필수적인 베이스라인 데이터와 통계적 맥락이 종종 부족하여 공격 효율성에 대한 모호한 주장을 초래한다고 주장합니다.
주요 요구사항에는 다음이 포함됩니다:
- 뺄셈 없이 동일한 작업 및 시드에서 일치하는 양성 제어율을 보고합니다.
- 정규 근사 대신 작은 샘플 크기(예: n=50)에 대한 성공률에 대해 윌슨 구간을 사용합니다.
- 이전 주장을 명확히 하기 위해 대상이 스텁, 로컬 체크포인트 또는 호스팅된 모델인지 명시적으로 표기합니다.
- 실패 횟수에 맥락을 제공하기 위해 검색 기반 공격의 결과 테이블에 쿼리 예산을 포함합니다.
저자는 이러한 표준이 적절한지에 대한 커뮤니티의 피드백을 구하고 있으며, 다른 하위 분야가 이미 유사한 보고 관행을 사용하고 있는지 묻습니다.