OpenAI a temporairement ralenti le rythme de développement de ses modèles, y compris une pause de deux semaines sur l'entraînement par apprentissage par renforcement (RL) pour les modèles à venir, après que des preuves préliminaires ont indiqué que son nouveau modèle, Astra, pourrait atteindre le seuil de capacité cybercritique. Cette décision fait suite à l'incident OpenAI-Hugging Face et vise à renforcer la surveillance, l'alignement et les garde-fous de confinement à mesure que les systèmes d'IA deviennent plus performants.

  • Les charges de travail impliquant Astra ou des modèles cyber nécessitent désormais les mesures de sécurité les plus strictes, y compris une isolation renforcée des charges de travail (bac à sable) et des contrôles réseau pour empêcher l'accès non autorisé à Internet.
  • Un nouveau système de surveillance multistage utilise des classificateurs d'activation pour détecter un comportement préoccupant, visant à émettre des alertes dans les 30 minutes suivant une violation potentielle de la frontière de sécurité critique.
  • Les techniques fondamentales d'alignement sont appliquées sur davantage d'étapes d'entraînement pour les modèles les plus performants afin de mieux détecter les comportements dangereux, le hacking de récompense et la tromperie.
  • La surcharge de surveillance est estimée à environ 20 % du calcul d'inférence surveillé, avec des équipes de sécurité alertées pour les notifications de plus haute priorité qui ne peuvent pas être résolues comme de faux positifs dans les 30 minutes.

OpenAI souligne que ces changements sont nécessaires car les risques associés au développement de systèmes d'IA de plus en plus performants augmentent, et que ses normes de sécurité doivent rester à l'avant-garde de ces risques pour garantir l'alignement et la sécurité.