A OpenAI reduziu temporariamente o ritmo de desenvolvimento de seus modelos, incluindo uma pausa de duas semanas no treinamento de aprendizado por reforço (RL) para os próximos modelos, após evidências preliminares indicarem que seu novo modelo, Astra, pode atingir o limiar de capacidade cibernética crítica. Essa decisão segue o incidente entre OpenAI e Hugging Face e visa fortalecer a monitoração, alinhamento e salvaguardas de contenção à medida que os sistemas de IA se tornam mais capazes.

  • Cargas de trabalho envolvendo Astra ou modelos cibernéticos agora exigem as salvaguardas de segurança mais rigorosas, incluindo isolamento mais forte de cargas de trabalho (sandboxes) e controles de rede para impedir acesso não autorizado à internet.
  • Um novo sistema de monitoramento em múltiplas etapas usa classificadores de ativação para detectar comportamento preocupante, visando emitir alertas dentro de 30 minutos para possíveis violações do limite crítico de segurança.
  • Técnicas centrais de alinhamento estão sendo aplicadas em mais etapas de treinamento para os modelos mais capazes, a fim de detectar melhor comportamentos inseguros, manipulação de recompensa e engano.
  • A sobrecarga de monitoramento é estimada em cerca de 20% do poder de inferência monitorado, com equipes de segurança sendo notificadas para alertas de maior prioridade que não possam ser resolvidos como falsos positivos dentro de 30 minutos.

A OpenAI enfatiza que essas mudanças são necessárias porque os riscos associados ao desenvolvimento de sistemas de IA cada vez mais capazes estão crescendo, e seus padrões de segurança devem permanecer à frente desses riscos para garantir alinhamento e segurança.