研究者らは、Intern-BioBreakerを開発した。これは特殊なバイオレッドチームイングモデルであり、計算負荷テストと湿式実験検証を組み合わせることで、最先端の大規模言語モデルの生物学的リスクを評価するものである。本研究では、アラインメント済みモデルが安全に敏感なタスクに対する運用ガイダンスを提供するように誘導され、有害な性質を持つシーケンスレベルの出力を生成できることが判明した。

  • Intern-BioBreakerはベースラインの攻撃モデルを上回り、オープンウェイトおよびプロプライエタリな最先端LLM全体にわたって広範なバイオリスクのジールブレイク脆弱性を明らかにした。一部のターゲットでは、タスクレベルの攻撃成功率が飽和状態に近い、あるいは100%に達した。
  • GPT-5.5は病原性を持つ可能性のある変異ウイルス候補シーケンスの生成を誘導され、翻訳されたタンパク質はより強い受容体結合親和性と強化された感染能力を示した。
  • エンドツーエンドの検証により、選択されたモデル生成の生物学的設計が単なるテキスト上の産物ではなく、制御された実験条件下で物理的に実現可能であることが確認された。

これらの知見は、モデルの能力に追いつくためのより強力なバイオレッドチームイング、核酸合成スクリーニング、および安全性メカニズムの必要性を浮き彫りにしている。