1

Eu já tive vários problemas devido a faltas de logs e metricas, alguns que consigo lembrar:
1-servidor lento, por causa de código xpto q rodava em uma instancia e atrasava mt, consegui pegar com tempo de execução
2-falta de cache, agr sempre que uma api está sofrendo muito hit de request eu cacheio e tenho alertas de whatsapp para cpu, error rate mt alto seja por erro internal ou por exemplo caso o cliente esteja mandando muito erro que barra no dto, crio uma informação sobre como enviar etc
3- já tive problema de auditoria de como os dados do cliente eram tratados, os logs de observabilidade me trouxe tudo que eu enviava a cada integração externa.
4- consigo mensurar e rastrear cada request q entra no meu software e cada query rodada, consigo ignorar e caso piore eu sei o que piorou
5- já aconteceu de ter erros de bibliotecas terceiras exemplo groupmq perder uma mensagem e eu saber exatamente qual mensagem foi perdida(mensagens de vendas de 2k reais não se pode perder sobre hipotese nenhuma) fiz sistema de retry e corriji aquele código

cara e sendo sincero sobre o tempo implementar essa branch aqui foi 2 semanas:

https://github.com/JulioVianaDev/telemetry-examples/tree/crons-grafana-tempo-prometheus-loki-otel

porém o tempo de aprender a olhar telemetria e tratamento de dados foi o que demorou muito, foram anos passando perrengue debugando código etc com diversos clientes até ter esse fluxo que funciona pra mim. então hj em dia eu sempre vou de newrelic primeiro e depois migro pra essa stack que fiz, e agora com ia consigo até por o claude code pra debugar erros caso aconteça e me entregar mais facil seguindo os padrões.

Carregando publicação patrocinada...