LLM evals: como medir se seu modelo presta
Você mudou o system prompt. O time de ML acha que ficou melhor. Mas “achar” não é métrica. Em infra, você não faz deploy sem rodar tests. Em AI, o equivalente é evals. LLM Evals são testes automatizados que medem a qualidade das respostas do modelo. É o seu test suite pro AI. Sem evals, toda mudança no pipeline (prompt, modelo, RAG, chunking) é um deploy no escuro. tl;dr: Evals são o baseline que separa melhoria real de opinião. Monte um golden dataset pequeno, rode métricas simples primeiro e compare toda mudança de prompt, modelo ou RAG antes de subir pra produção. ...