Troubleshooting playbook: os incidentes que vão te acordar às 2AM

Décimo segundo post da série. No anterior, operamos Azure OpenAI com HA e retry decente. Agora vem a parte menos charmosa: quando o diagrama bonito encosta na vida real. Este post está organizado em cenários reais de falha. Cada um segue: Sintomas → Diagnóstico → Root cause → Resolução → Prevenção. Leia uma vez pra formar repertório. Depois deixa salvo. Você ainda vai voltar aqui. tl;dr: Este playbook cobre cinco falhas comuns em workloads de AI: driver, CUDA OOM, pod Pending, 429 e latência. A meta é reduzir o tempo entre sintoma, hipótese e ação segura. ...

6 de junho de 2026 · 8 minutos · Ricardo Martins

GPU deep dive: o que acontece dentro do silício

Quarto post da série. No anterior, você viu quais VMs GPU provisionar e como conectar elas. Agora a ideia é olhar dentro da GPU pra entender o que acontece no silício. Não pra escrever CUDA kernel, mas pra ser um troubleshooter melhor e conversar com o time de ML sem ficar no modo adivinhação. tl;dr: O tamanho do checkpoint não diz quanta VRAM o treino vai consumir. Em GPU, pesos são só o começo. Gradientes, ativações e estado do otimizador é que costumam explodir a conta. ...

5 de maio de 2026 · 12 minutos · Ricardo Martins

Compute para AI: escolhendo o hardware certo (e conectando ele direito)

Terceiro post da série onde traduzo AI pra linguagem de quem vive infraestrutura. No post anterior, falamos do gargalo escondido de storage. Hoje a conversa é sobre compute. A diferença não está em comprar a GPU mais cara da prateleira. Está em escolher a GPU certa e ligar tudo do jeito certo. tl;dr: Em AI, escolher compute é escolher workload, memória e interconexão. GPU errada ou rede errada faz você pagar caro pra terminar mais devagar. ...

1 de maio de 2026 · 12 minutos · Ricardo Martins

Dados e storage para workloads de AI: o gargalo que ninguém vê

Esse é o segundo post da série onde traduzo o mundo de AI pra linguagem de engenheiros de infraestrutura. No primeiro post, mostrei que AI é só mais um workload e que suas habilidades de infra já te deixam bem mais perto desse mundo do que parece. Agora é hora de falar do gargalo que quase todo mundo descobre tarde demais: storage. tl;dr: GPU cara parada quase sempre significa dado chegando devagar. Pra treino de AI, storage e cache local decidem a utilização da GPU tanto quanto a placa que você comprou. ...

27 de abril de 2026 · 10 minutos · Ricardo Martins

AI para engenheiros de infraestrutura: por que AI precisa de você

Esse é o primeiro post de uma série onde vou traduzir o mundo de AI pra linguagem que engenheiros de infraestrutura já falam. Se você é o tipo de profissional que configura VMs, monta pipelines de CI/CD e acorda de madrugada quando o Nagios dispara, esse conteúdo é pra você. A série é baseada no meu livro open-source AI for Infrastructure Professionals, adaptada e expandida aqui em português. tl;dr: AI não pede que você vire data scientist. Pede que você aplique o que já sabe de compute, rede, segurança, observabilidade e custos num workload novo. O jargão muda. Os fundamentos continuam. ...

26 de abril de 2026 · 8 minutos · Ricardo Martins