Anthropic делает автоматический режим настройкой по умолчанию для новых сессий в Claude Code для тарифов Pro, Max и Team начиная с 14 августа. Это изменение отражает уверенность компании в способности функции эффективнее смягчать такие риски, как инъекция промптов и утечка данных, по сравнению с человеческим обзором.

  • Контролируемое исследование 1053 платных тестировщиков показало, что автоматический режим заблокировал бы 89% вредоносных действий, по сравнению с лишь 13,6%, отклонёнными людьми.
  • Оценка от Trajectory Labs протестировала 720 сценариев косвенной инъекции промптов против Claude Fable 5, Opus 5 и Sonnet 5 в автоматическом режиме.

Ни одна из 720 попыток атаки не удалась против указанных моделей Claude во время независимой оценки.

Anthropic считает этот сдвиг важным, потому что усталость от подтверждения приводит к небезопасному поведению у человеческих рецензентов, тогда как автоматический режим значительно снижает воздействие вредоносных инструкций.