L'AI Evaluator Forum a publié l'AEF-1, une proposition de référence pour les évaluations indépendantes d'IA par des tiers, couvrant l'accès, les conflits d'intérêts, les relations de financement, la récusation et la transparence. Ce standard émerge parallèlement à la proposition de Dario Amodei visant à ce que les entreprises d'IA de pointe s'engagent à offrir un accès continu, semblable à celui des employés, aux évaluateurs tiers intégrés.
- L'AEF-1 établit des exigences d'indépendance, incluant des règles sur les conflits d'intérêts et le financement.
- Anthropic s'engage unilatéralement à fournir un accès sans précédent à ses équipes de sécurité, y compris des bureaux physiques et des outils internes.
- Le débat plus large inclut des appels à moduler le rythme des progrès plutôt qu'à se concentrer sur le contrôle et la containment.
- GitHub a ajouté des niveaux de sélection automatique de modèles aux flux de travail Copilot/Codex.
- Cline a lancé une application desktop native pour travailler avec des modèles à poids ouverts.
La publication de l'AEF-1 signale un mouvement vers une autorégulation formalisée et une vérification indépendante au sein de l'industrie.