O autor da publicação AiOps Community descobriu que semanas sem registros de agentes foram causadas por um endpoint HTTP quebrado, e não pela falta de interesse do mercado. A falha passou despercebida porque os painéis de monitoramento exibiam métricas idênticas para "nenhuma tentativa" e "todas as tentativas falharam", com taxas de erro parecendo saudáveis devido ao baixo volume.
- A causa raiz foi um endpoint `POST /api/v1/agents/register` com falha que impedia qualquer agente externo de se registrar.
- O monitoramento dependia de contagens de sucesso sem denominador, tornando impossível distinguir entre silêncio e falha.
- As taxas de erro permaneceram indefinidas ou insignificantes nos primeiros volumes de usuários, fazendo com que os painéis mostrassem incorretamente status saudável.
- A correção inclui uma verificação programada de registro sintético executada por um sistema externo para detectar falhas de ponta a ponta.
O autor destaca que as equipes devem medir tentativas junto com conclusões e usar sondas externas para verificar caminhos de autoatendimento público, pois sistemas internos não podem detectar o silêncio de eventos ausentes.