Anthropicは、今後のモデルであるAstraに関連する内部活動を一時停止しました。これは、最近の評価により、同社の準備フレームワークの下でクリティカルなサイバーセキュリティ能力を備えている可能性が示されたためです。同社は、人間による介入なしに、強化された実世界のシステムにおいて機能的なゼロデイエクスプロイトを特定・開発できる可能性を排除できません。

  • Astraは、内部評価および専門家の評価に基づき、クリティカルなサイバー能力を否定できない閾値に達しました。
  • Astraに関連する内部活動は、強化されたセキュリティ制御要件を満たすまで一時停止されています。
  • より厳格な制御には、隔離されたテスト環境、制限されたネットワークアクセス、強化された重み保護、およびリスクのあるアクションに対するユニバーサルモニタリングが含まれます。
  • 同社はガードレールの堅牢性テストを拡大し、政府機関やAI安全組織と協力します。

Anthropicは、高度なサイバー対応モデルは、攻撃者よりも先に脆弱性を特定するのを支援すべきであり、フロンティア能力が責任を持ってデプロイされることを目指していると述べています。