AI coding workflow: como usar AI no dia a dia

Último post da série. Depois de 16 textos olhando pra dentro da AI, eu queria fechar com o uso prático. Como essas ferramentas entram no trabalho de infra sem virar bengala. É um post bem opinativo. Estou escrevendo do lugar de quem usa Copilot, Claude e chat com LLM todo dia desde 2023. Tem coisa que acelera muito. Tem coisa que atrapalha. E tem anti-pattern que eu já vi time repetir até cansar. ...

4 de agosto de 2026 · 8 minutos · Ricardo Martins

Implementando um assistente pessoal com IA no Azure, passo a passo

No post anterior, eu desenhei um assistente que consulta runbooks, mantém contexto e chama ferramentas de infraestrutura. A arquitetura fazia sentido, mas ainda tinha um problema: os exemplos eram recortes. Faltavam os arquivos que conectam uma parte à outra. Este post fecha essa lacuna. Vamos partir de uma aplicação que roda localmente sem Azure e levar a mesma vertical slice para Container Apps, Azure OpenAI e Azure AI Search. O código está no repositório agentic-infra-handbook, em labs/personal-assistant. O README do lab também traz um passo a passo independente para executar o projeto localmente e fazer o deploy no Azure, incluindo App Registration, configuração do AZD, callback de autenticação, validação e limpeza dos recursos. ...

3 de agosto de 2026 · 18 minutos · Ricardo Martins

Projetando um assistente pessoal com IA

Depois de 13 posts sobre os componentes de um sistema de IA, faltava colocá-los para trabalhar juntos. O projeto deste artigo é um assistente pessoal que responde perguntas sobre infraestrutura usando runbooks, documentação interna e ferramentas de monitoramento. O desenho é próximo do que eu usaria numa entrevista de system design ou como ponto de partida para um design doc interno. Os exemplos de código são recortes, não uma aplicação pronta para copiar e colocar em produção. ...

1 de agosto de 2026 · 11 minutos · Ricardo Martins

Como MCP funciona: o protocolo que conecta agents ao mundo

Cada vez que um agent precisa acessar um novo data source, alguém escreve uma integração custom. GitHub? Integração custom. Jira? Integração custom. Azure Monitor? Integração custom. Banco de dados? Mais uma. Se isso parece com o problema que REST/HTTP resolveu pra APIs web, você está pensando certo. MCP (Model Context Protocol) é a tentativa de padronizar como AI models e agents se conectam a data sources e ferramentas. O mapa pro profissional de infra Conceito MCP O que faz Equivalente em infra MCP Server Expõe dados/ferramentas via protocolo padrão API server, microserviço MCP Client Consome dados/ferramentas de MCP servers API client, SDK Host Aplicação que roda o client (VS Code, Claude, etc.) Browser, app que consome APIs Tool Função executável via MCP Endpoint REST (POST /action) Resource Dado acessível via MCP Endpoint REST (GET /data) Prompt Template de interação Slash command, prompt salvo, formulário parametrizado Transport Como client e server se comunicam stdio, Streamable HTTP (SSE legado só por compatibilidade) O problema N×M Antes de MCP, cada combinação de (AI application × data source) precisava de código custom. ...

29 de julho de 2026 · 9 minutos · Ricardo Martins

Arquitetura multi-agent: orquestrando a complexidade

Um agent sozinho é como aquele microserviço que nasceu pequeno e, de repente, quer resolver tudo. Funciona até certo ponto. Depois vira confusão. Quando a tarefa cresce, especialização ajuda. Se você já migrou de monolito pra microservices, o raciocínio aqui vai soar familiar. As perguntas são quase as mesmas. Como eles se comunicam? Quem coordena? O que acontece quando um falha? Quanto custa essa coordenação? O mapa pro profissional de infra Conceito Multi-Agent O que faz Equivalente em infra Orchestrator Coordena agents, delega tarefas API Gateway, Workflow engine Worker agent Executa tarefas específicas Microserviço Message passing Comunicação entre agents Message queue (Service Bus) Shared state Dados compartilhados entre agents Database, Redis Handoff Transferir contexto entre agents Request forwarding Supervisor Monitora e intervém quando algo falha Kubernetes controller, watchdog Consensus Múltiplos agents concordam numa decisão Raft, quorum Quando usar multi-agent Cenário Single agent Multi-agent Task de 3-5 steps num domínio Ideal Overkill Task que cruza múltiplos domínios (DB + rede + app) Fica confuso Ideal Task onde diferentes partes precisam de tools diferentes Tools demais Separação natural Task onde precisas de “second opinion” Possível (reflection) Mais robusto Task com trabalho paralelizável Limitado Escala melhor Regra prática: se um agent já está carregando tools demais e você precisa explicar o mapa inteiro do mundo pra ele funcionar, provavelmente chegou a hora de quebrar em mais de um. ...

26 de julho de 2026 · 8 minutos · Ricardo Martins

Padrões agentic: os building blocks

Se agents são controllers (LLM + tools + loop), padrões agentic são os design patterns que esses controllers usam. Assim como em software tradicional você tem Observer, Strategy e Chain of Responsibility, em AI agents também existem padrões que aparecem o tempo todo. Saber reconhecer esses patterns encurta bastante o caminho. Em vez de desenhar tudo do zero a cada caso, você monta a solução com blocos que já provaram valor. ...

23 de julho de 2026 · 9 minutos · Ricardo Martins

AI agents: memória, estado e consistência

Seu agent de diagnóstico vai bem numa interação. Aí o mesmo alerta volta na semana seguinte e ele zera a memória. Não lembra que já investigou. Não lembra que a causa raiz era aquele cronjob que explode memória toda quarta às 3h da manhã. Agent sem memória é como engenheiro que perde o caderno toda segunda. Sabe trabalhar. Só reaprende as mesmas coisas o tempo todo. O mapa pro profissional de infra Conceito de Memória O que faz Equivalente em infra Short-term memory Contexto da conversa atual Buffer de request (dados in-flight) Long-term memory Informações que persistem entre sessões Database, persistent storage Episodic memory Lembranças de interações passadas Logs, audit trail Semantic memory Conhecimento geral acumulado Knowledge base, wiki Working memory O que está “ativo” na cabeça do agent Cache, working set State Configuração atual do agent Estado do pod, configmap Consistency Garantia de que memória é correta Consistency model do banco Por que memória é difícil em agents LLMs são stateless. Cada request é independente. O modelo não “lembra” nada entre chamadas. Toda memória é simulada via contexto. ...

20 de julho de 2026 · 10 minutos · Ricardo Martins

Como projetar um AI agent do zero

No post anterior, eu destrinchei como agents funcionam: LLM, tools e loop. Agora a conversa muda de nível. O problema não é fazer um demo de 5 minutos. É projetar um agent que aguente produção, rode 24/7 e não precise de babá. Continua sendo design de sistema, com as perguntas de sempre: quais são os requisitos, quais os failure modes, como escala e como monitora? As 5 decisões de design Projetar um agent normalmente vira 5 decisões: ...

17 de julho de 2026 · 9 minutos · Ricardo Martins

Como AI agents funcionam por dentro

Terça-feira, 14h. Seu colega mostra um demo: ele pede pro “agent” verificar o status de 5 servidores, identificar qual tem mais CPU usage, e criar um ticket pra investigação. O agent faz tudo sozinho. Sem scripts. Sem runbooks. Seu primeiro pensamento: “Isso é só um LLM chamando APIs, certo?” Sim. E não. O conceito é simples. A parte trabalhosa é fazer isso funcionar com segurança e previsibilidade em produção. É aí que mora a engenharia de verdade. ...

14 de julho de 2026 · 10 minutos · Ricardo Martins

Machine learning system design: o que todo infra deveria saber

O time de ML treinou um modelo que funciona no notebook. Accuracy de 94%. Todo mundo comemora. Aí vem a parte menos glamourosa: colocar isso em produção. “Dá pra colocar isso numa API com 99.9% de uptime, latência < 200ms e 10K requests por segundo?” É aqui que system design de ML cai no colo de infra. A boa notícia é que a maior parte do problema parece familiar. Serving, rollout, observabilidade e capacity planning continuam sendo trabalho de sistema distribuído. O pedaço realmente diferente existe, mas é menor do que o hype sugere. ...

11 de julho de 2026 · 8 minutos · Ricardo Martins