Anthropic está estableciendo el modo automático como la configuración predeterminada para nuevas sesiones en Claude Code para los planes Pro, Max y Team a partir del 14 de agosto. Este cambio refleja la confianza de la empresa en la capacidad de la función para mitigar riesgos como la inyección de prompts y la exfiltración de datos de manera más efectiva que la revisión humana.
- Un estudio controlado de 1.053 probadores pagados encontró que el modo automático habría bloqueado el 89% de las acciones dañinas, en comparación con solo el 13,6% rechazado por humanos.
- Una evaluación de Trajectory Labs probó 720 escenarios de inyección indirecta de prompts contra Claude Fable 5, Opus 5 y Sonnet 5 ejecutando el modo automático.
Ninguno de los 720 intentos de ataque tuvo éxito contra los modelos Claude especificados durante la evaluación de terceros.
Anthropic considera este cambio importante porque la fatiga de confirmación lleva a comportamientos inseguros en los revisores humanos, mientras que el modo automático reduce significativamente la exposición a instrucciones maliciosas.