A Anthropic está tornando o modo automático a configuração padrão para novas sessões no Claude Code para os planos Pro, Max e Team a partir de 14 de agosto. Essa mudança reflete a confiança da empresa na capacidade do recurso de mitigar riscos como injeção de prompts e exfiltração de dados de forma mais eficaz do que a revisão humana.

  • Um estudo controlado com 1.053 testadores pagos descobriu que o modo automático teria bloqueado 89% das ações prejudiciais, em comparação com apenas 13,6% recusados por humanos.
  • Uma avaliação da Trajectory Labs testou 720 cenários de injeção indireta de prompts contra Claude Fable 5, Opus 5 e Sonnet 5 executando o modo automático.

Nenhum dos 720 tentativas de ataque teve sucesso contra os modelos Claude especificados durante a avaliação de terceiros.

A Anthropic considera essa mudança importante porque a fadiga de confirmação leva a comportamentos inseguros em revisores humanos, enquanto o modo automático reduz significativamente a exposição a instruções maliciosas.