El autor de la publicación AiOps Community descubrió que las semanas con cero registros de agentes fueron causadas por un punto de conexión HTTP roto, no por falta de interés del mercado. La falla pasó desapercibida porque los paneles de monitoreo mostraban métricas idénticas para "sin intentos" y "todos los intentos fallaron", con tasas de error que parecían saludables debido al bajo volumen.
- La causa raíz fue un punto de conexión `POST /api/v1/agents/register` defectuoso que impedía que cualquier agente externo se registrara.
- El monitoreo dependía de los conteos de éxito sin un denominador, lo que hacía imposible distinguir entre silencio y falla.
- Las tasas de error permanecieron indefinidas o insignificantes a volúmenes iniciales de usuarios, haciendo que los paneles mostraran incorrectamente un estado saludable.
- La corrección incluye una verificación programada de registro sintético ejecutada por un sistema externo para detectar fallas de extremo a extremo.
El autor destaca que los equipos deben medir los intentos junto con las completaciones y usar sondas externas para verificar las rutas de autoservicio público, ya que los sistemas internos no pueden detectar el silencio de eventos faltantes.