نشرت LatchBio تحليلاً مستقلاً لـ Grok 4.6 على منصتي BioSecBench-Refusal و BioSecBench-Surveillance، ووجدت أن النموذج هو الأقوى في رفض المهام الخطرة المخفية بين الأنظمة الحدودية المختبرة.
- على BioSecBench-Refusal، حقق Grok 4.6 متوسطاً توافقياً مرجحاً بالمحاولات يبلغ 62.1٪، حيث رفض 59.2٪ من مهام فريق الاختراق الأحمر بينما أكمل 64.8٪ من المهام الروتينية.
- هو النظام الوحيد المختبر الذي حصل على درجة تزيد عن 50٪ في كل من مقياسي الرفض والامتثال الروتيني.
- على BioSecBench-Surveillance، سجل Grok 4.6 متوسط معدل نجاح يبلغ 53.5٪، مما يضعه خلف Opus 5 وأمام GPT-5.6 Sol.
- أظهر النموذج القدرة على اكتشاف التناقضات في النوايا ضمن المحتوى عالي الخطورة المخفي بأسماء الملفات والتشفير.
تشير هذه النتائج إلى أن Grok 4.6 مُعاير جيداً لأعمال البيولوجيا الروتينية مع توفير ضوابط أمان قوية ضد الاستخدام العدائي، مما يدعم هدف SpaceXAI في تقديم ذكاء الحدودي بشكل آمن.