LatchBio publicó un análisis independiente de Grok 4.6 en sus benchmarks BioSecBench-Refusal y BioSecBench-Surveillance, encontrando que el modelo es el más fuerte al rechazar tareas peligrosas disfrazadas entre los sistemas fronterizos evaluados.
- En BioSecBench-Refusal, Grok 4.6 logró una media armónica ponderada por ensayo del 62,1%, rechazando el 59,2% de las tareas de red team mientras completaba el 64,8% de las habituales.
- Es el único sistema evaluado que obtiene más del 50% tanto en medidas de rechazo como de cumplimiento habitual.
- En BioSecBench-Surveillance, Grok 4.6 promedió una tasa de éxito del 53,5%, situándose detrás de Opus 5 pero por delante de GPT-5.6 Sol.
- El modelo demostró la capacidad de detectar discrepancias de intención en contenido de alto riesgo disfrazado mediante nombres de archivo y cifrado.
Estos resultados indican que Grok 4.6 está bien calibrado para el trabajo biológico habitual mientras proporciona salvaguardas robustas contra el uso adversarial, apoyando el objetivo de SpaceXAI de servir inteligencia fronteriza de forma segura.