Sangfor ha desplegado SESG (Self-Evolving Safety Guardrails), un sistema multiagente que adapta continuamente las defensas de seguridad de LLM ante nuevas amenazas en producción. El sistema monitorea el tráfico en vivo para detectar jailbreaks novedosos y categorías dañinas, luego sintetiza automáticamente datos de entrenamiento y actualiza el modelo sin intervención manual.
- SESG utiliza agentes de generación, validación y enrutamiento para diagnosticar fallos y crear lotes de entrenamiento dirigidos.
- Un guardrail de 1.7B se adapta a nuevas amenazas en 16-24 horas con solo unas 2 horas de esfuerzo humano, en comparación con las 40-90 horas de los procesos manuales.
- El sistema supera a los guardrails estáticos que van de 0.6B a 9B parámetros y una línea base adaptativa en seis amenazas emergentes.
- Desde abril de 2026, SESG ha cerrado autónomamente 14 de 15 nuevos escenarios de amenaza en dos meses.
Este enfoque permite que los modelos de seguridad mantengan el ritmo con vectores de ataque en rápida evolución mientras mantienen la competencia general de filtrado.