Anthropic se asocia con el negocio especializado en IA de Accenture para realizar evaluaciones independientes y pruebas de penetración (red-teaming) de sus modelos de vanguardia. Esta iniciativa apoya el compromiso de Anthropic de integrar evaluadores dentro de la empresa, permitiéndoles monitorear el desarrollo de los modelos y verificar los compromisos de seguridad.

  • La asociación implica evaluar modelos, realizar evaluaciones de alineación y probar las salvaguardas.
  • Ambas compañías esperan invertir al menos 1.000 millones de dólares en esta área durante los próximos cinco años.
  • Los evaluadores integrados tendrán un acceso comparable al de los empleados para observar los procesos de entrenamiento e identificar puntos ciegos.
  • Anthropic financiará directamente el trabajo de Accenture mientras explora otros arreglos de financiación para futuros evaluadores.

Este enfoque tiene como objetivo hacer la rendición de cuentas más verificable permitiendo que partes independientes evalúen cómo se construyen y despliegan los modelos, aunque los estándares para dicha evaluación integrada aún se están desarrollando.