OpenAI ha publicado un marco que describe su enfoque para apoyar evaluaciones independientes de modelos de IA avanzada por parte de terceros. La organización enfatiza que estas evaluaciones son críticas para equilibrar la responsabilidad con la rendición de cuentas, requiriendo acceso profundo a los datos de entrenamiento, evaluación y despliegue.
- Evaluación independiente de casos de seguridad que abarcan el entrenamiento, el despliegue interno y el despliegue externo.
- Evaluación de salvaguardas críticas contra pruebas adversarias, jailbreaks y aumento de capacidades en dominios de alto riesgo.
- Evaluación de métricas de capacidad que cubren categorías de riesgo de preparación como ciberseguridad y riesgos biológicos.
- Investigación de incidentes críticos de desalineación para identificar factores contribuyentes y la efectividad de las salvaguardas.
El marco tiene como objetivo establecer estándares internacionales compartidos para prácticas de seguridad, permitiendo a los evaluadores desafiar los supuestos de los laboratorios y verificar las afirmaciones de seguridad a través de un trabajo riguroso, seguro e independiente.