Anthropic s'associe au service spécialisé en IA d'Accenture pour mener des évaluations indépendantes et des tests de pénétration (red-teaming) de ses modèles de pointe. Cette initiative soutient l'engagement d'Anthropic à intégrer des évaluateurs au sein de l'entreprise, leur permettant de surveiller le développement des modèles et de vérifier les engagements en matière de sécurité.
- Le partenariat implique d'évaluer les modèles, de réaliser des évaluations d'alignement et de tester les garde-fous.
- Les deux entreprises prévoient d'investir au moins 1 milliard de dollars dans ce domaine au cours des cinq prochaines années.
- Les évaluateurs intégrés auront un accès comparable à celui des employés pour observer les processus d'entraînement et identifier les angles morts.
- Anthropic financera directement le travail d'Accenture tout en explorant d'autres arrangements de financement pour les futurs évaluateurs.
Cette approche vise à rendre la responsabilité plus vérifiable en permettant à des parties indépendantes d'évaluer comment les modèles sont construits et déployés, bien que les normes pour une telle évaluation intégrée soient encore en cours de développement.