Anthropicは、Accentureの専門AI事業部門と提携し、最先端モデルの独立した評価およびレッドチーム演習を実施します。このイニシアチブは、Anthropicが社内に対象評価者を配置し、モデルの開発を監視して安全性へのコミットメントを検証するという約束をサポートするものです。
- 提携には、モデルの評価、アライメント評価の実施、およびガードレールのテストが含まれます。
- 両社は今後5年間でこの分野に少なくとも10億ドルを投資する予定です。
- 組み込み評価者は、トレーニングプロセスを観察し、盲点を特定するために従業員と同等のアクセス権限を取得します。
- AnthropicはAccentureの作業を直接資金提供しつつ、将来の評価者向けの他の資金調達 arrangement を探ります。
このアプローチは、モデルがどのように構築され展開されるかを独立した第三者が評価できるようにすることで、説明責任をより検証可能にすることを目指していますが、此类の組み込み評価に関する基準はまだ開発中です。