Platform Engineering no Azure: governança, observabilidade e segurança do IDP (Parte 2)

Na Parte 1, montamos a base do Internal Developer Platform: Dev Center, templates Bicep para provisionamento self-service e AKS como runtime compartilhado com multi-tenancy. Aqui entram as camadas que deixam a plataforma segura, observável e governada. tl;dr: Governança com Azure Policy, observabilidade com App Insights + Grafana, e segurança com Workload Identity e Entra ID. Sem essas camadas, o IDP vira self-service sem controle. Governança: Azure Policy como guardrail A plataforma precisa garantir que, independente do que o desenvolvedor faça dentro do seu namespace ou resource group, certos padrões sejam mantidos. Azure Policy é a ferramenta para isso. ...

13 de julho de 2026 · 10 minutos · Ricardo Martins

Postmortems no Azure: automação com Azure DevOps e métricas de aprendizado (Parte 2)

Na Parte 1, falamos de cultura blameless, template de postmortem, queries KQL e automação com Logic Apps. Aqui, o foco é ligar o postmortem ao fluxo de engenharia: Azure DevOps, métricas de eficácia, cenários avançados e reuniões de revisão. tl;dr: O postmortem sem rastreamento vira documento esquecido. Ligue ao Azure DevOps para action items, use Workbooks para métricas de eficácia e vincule ao Error Budget para decidir congelamento de deploys. Integrando postmortems com Azure DevOps O Azure DevOps é o lugar natural para rastrear action items de postmortems. A chave é conectar os insights do postmortem diretamente ao backlog de engenharia. ...

13 de julho de 2026 · 10 minutos · Ricardo Martins

Postmortems no Azure: análise pós-incidente blameless com Azure Monitor (Parte 1)

Você já automatizou alertas e runbooks, definiu SLIs, SLOs e Error Budgets e validou resiliência com Engenharia de Caos. Mas quando o incidente termina, o que acontece? Na maioria das organizações, nada. O alerta é resolvido e todo mundo segue a vida. Até o mesmo problema voltar. Sem uma análise pós-incidente decente, a organização repete os mesmos erros. O postmortem blameless transforma falhas em aprendizado e evita que incidentes recorrentes continuem corroendo seu Error Budget. ...

13 de julho de 2026 · 11 minutos · Ricardo Martins

LLM evals: como medir se seu modelo presta

Você mudou o system prompt. O time de ML acha que ficou melhor. Mas “achar” não é métrica. Em infra, você não faz deploy sem rodar tests. Em AI, o equivalente é evals. LLM Evals são testes automatizados que medem a qualidade das respostas do modelo. É o seu test suite pro AI. Sem evals, toda mudança no pipeline (prompt, modelo, RAG, chunking) é um deploy no escuro. tl;dr: Evals são o baseline que separa melhoria real de opinião. Monte um golden dataset pequeno, rode métricas simples primeiro e compare toda mudança de prompt, modelo ou RAG antes de subir pra produção. ...

8 de julho de 2026 · 8 minutos · Ricardo Martins