A Anthropic está se associando ao negócio especializado em IA da Accenture para conduzir avaliações independentes e testes de penetração (red-teaming) de seus modelos de fronteira. Esta iniciativa apoia o compromisso da Anthropic de incorporar avaliadores dentro da empresa, permitindo que monitorem o desenvolvimento dos modelos e verifiquem os compromissos de segurança.
- A parceria envolve avaliar modelos, realizar avaliações de alinhamento e testar salvaguardas.
- Ambas as empresas esperam investir pelo menos US$ 1 bilhão nesta área nos próximos cinco anos.
- Os avaliadores integrados terão acesso comparável ao dos funcionários para observar os processos de treinamento e identificar pontos cegos.
- A Anthropic financiará diretamente o trabalho da Accenture enquanto explora outros arranjos de financiamento para futuros avaliadores.
Esta abordagem visa tornar a prestação de contas mais verificável, permitindo que partes independentes avaliem como os modelos são construídos e implantados, embora os padrões para tal avaliação integrada ainda estejam em desenvolvimento.