O AI Evaluator Forum publicou o AEF-1, uma proposta de linha de base para avaliações independentes de IA por terceiros, abrangendo acesso, conflitos de interesse, relacionamentos de financiamento, renúncia e transparência. Este padrão surge junto à proposta de Dario Amodei para que empresas de IA de fronteira se comprometam a fornecer acesso contínuo, semelhante ao de funcionários, para avaliadores de terceiros embutidos.

  • O AEF-1 estabelece requisitos de independência, incluindo regras sobre conflitos de interesse e financiamento.
  • A Anthropic está unilateralmente comprometida em fornecer acesso sem precedentes às suas equipes de segurança, incluindo mesas no escritório e ferramentas internas.
  • O debate mais amplo inclui chamadas para controlar o ritmo do progresso versus focar no controle e contenção.
  • O GitHub adicionou camadas de seleção automática de modelos aos fluxos de trabalho do Copilot/Codex.
  • O Cline lançou um aplicativo nativo para desktop para trabalhar com modelos de peso aberto.

A publicação do AEF-1 sinaliza uma mudança em direção à autorregulamentação formalizada e verificação independente dentro da indústria.