A OpenAI publicou um framework que descreve sua abordagem para apoiar avaliações independentes de modelos de IA avançada por terceiros. A organização enfatiza que essas avaliações são críticas para equilibrar responsabilidade com prestação de contas, exigindo acesso profundo aos dados de treinamento, avaliação e implantação.

  • Avaliação independente de casos de segurança abrangendo treinamento, implantação interna e implantação externa.
  • Avaliação de salvaguardas críticas contra testes adversariais, jailbreaks e aumento de capacidades em domínios de alto risco.
  • Avaliação de métricas de capacidade que cobrem categorias de risco de prontidão como cibersegurança e riscos biológicos.
  • Investigação de incidentes críticos de desalinhamento para identificar fatores contribuintes e a eficácia das salvaguardas.

O framework visa estabelecer padrões internacionais compartilhados para práticas de segurança, permitindo que avaliadores desafiem as suposições dos laboratórios e verifiquem as alegações de segurança por meio de trabalho rigoroso, seguro e independente.