Разработчик SecFathy открыл исходный код исследовательского прототипа под названием XSS Specialist, модели безопасности на 8B параметров, предназначенной для анализа уязвимостей XSS. Изначально проект ставил целью расширение пределов специализации с помощью механизмов извлечения контекста и LoRA, но в итоге от модели отказались, поскольку она не прошла тесты на устойчивость к состязательным атакам: небольшие изменения идентификаторов приводили к неверным решениям о безопасности.

  • Разработчик переработал систему, разделив процесс рассуждения и установления фактов, перенеся полномочия подтверждения в независимый слой выполнения.
  • Потенциальное обнаружение XSS подтверждается только тогда, когда настоящий безголовый браузер выполняет безопасный контрольный сигнал.
  • На замороженном бенчмарке с 102 реальными случаями полученная архитектура достигла точности 94.1% и полноты 100% при нулевом количестве ложноотрицательных результатов.
  • Исходный код, архитектура, бенчмарки и отрицательные результаты доступны на GitHub по адресу SecFathy/xss-specialist.

Автор утверждает, что надёжные ИИ-системы должны проектироваться так, чтобы оставаться функциональными даже при ошибках модели, а не полагаться исключительно на доверие к самой модели.