LatchBio menerbitkan analisis independen tentang Grok 4.6 pada benchmark BioSecBench-Refusal dan BioSecBench-Surveillance, menemukan bahwa model tersebut paling kuat dalam menolak tugas berbahaya yang disamarkan di antara sistem terdepan yang diuji.

  • Pada BioSecBench-Refusal, Grok 4.6 mencapai rata-rata harmonik tertimbang percobaan sebesar 62,1%, menolak 59,2% dari tugas red-team sambil menyelesaikan 64,8% dari tugas rutin.
  • Ini adalah satu-satunya sistem yang diuji dengan skor di atas 50% pada kedua ukuran penolakan dan kepatuhan rutin.
  • Pada BioSecBench-Surveillance, Grok 4.6 mencatatkan rata-rata tingkat keberhasilan sebesar 53,5%, menempatkannya di belakang Opus 5 tetapi di depan GPT-5.6 Sol.
  • Model tersebut menunjukkan kemampuan untuk mendeteksi ketidaksesuaian niat dalam konten berisiko tinggi yang disamarkan oleh nama file dan enkripsi.

Hasil-hasil ini menunjukkan bahwa Grok 4.6 telah dikalibrasi dengan baik untuk pekerjaan biologis rutin sambil memberikan perlindungan kuat terhadap penggunaan adversarial, mendukung tujuan SpaceXAI untuk melayani kecerdasan terdepan secara aman.