OpenAI a publié un cadre décrivant son approche pour soutenir les évaluations indépendantes de modèles d'IA de pointe par des tiers. L'organisation souligne que ces évaluations sont cruciales pour équilibrer la responsabilité avec la reddition de comptes, nécessitant un accès approfondi aux données d'entraînement, d'évaluation et de déploiement.

  • Évaluation indépendante des cas de sécurité couvrant l'entraînement, le déploiement interne et le déploiement externe.
  • Évaluation des sauvegardes critiques contre les tests adversariaux, les jailbreaks et l'amélioration des capacités dans les domaines à haut risque.
  • Évaluation des métriques de capacité couvrant les catégories de risque de préparation comme la cybersécurité et les risques biologiques.
  • Investigation des incidents critiques de désalignement pour identifier les facteurs contributifs et l'efficacité des sauvegardes.

Le cadre vise à établir des normes internationales partagées pour les pratiques de sécurité, permettant aux évaluateurs de remettre en question les hypothèses des laboratoires et de vérifier les affirmations de sécurité par un travail rigoureux, sécurisé et indépendant.