A Anthropic está se associando ao negócio especializado em IA da Accenture para conduzir avaliações independentes e testes de penetração (red-teaming) de seus modelos de fronteira. Esta iniciativa apoia o compromisso da Anthropic de incorporar avaliadores dentro da empresa, permitindo que monitorem o desenvolvimento dos modelos e verifiquem os compromissos de segurança.

  • A parceria envolve avaliar modelos, realizar avaliações de alinhamento e testar salvaguardas.
  • Ambas as empresas esperam investir pelo menos US$ 1 bilhão nesta área nos próximos cinco anos.
  • Os avaliadores integrados terão acesso comparável ao dos funcionários para observar os processos de treinamento e identificar pontos cegos.
  • A Anthropic financiará diretamente o trabalho da Accenture enquanto explora outros arranjos de financiamento para futuros avaliadores.

Esta abordagem visa tornar a prestação de contas mais verificável, permitindo que partes independentes avaliem como os modelos são construídos e implantados, embora os padrões para tal avaliação integrada ainda estejam em desenvolvimento.