Último post da série. No anterior, a gente montou o framework de adoção em 6 fases. Agora vem a cola final.

Você já fala infraestrutura com fluência. AI não é idioma alienígena. É um dialeto com nome ruim e sigla demais. Este glossário faz a ponte entre os termos de AI e os conceitos de infra que você já usa todo dia.

tl;dr: Use este post como tabela de tradução rápida. Se um termo de AI travar a conversa, volte aqui e mapeie para o equivalente de infra antes de discutir ferramenta ou arquitetura.

Como usar

Cada entrada tem o termo de AI, a analogia de infra, uma definição curta e onde isso aparece na prática. Organizei em 6 blocos pra ficar fácil achar o que interessa sem fingir que você lembra tudo de cabeça.

Conceitos centrais de AI

Termo AIAnalogia de infraDefiniçãoQuando aparece
ModelBinário compiladoO artefato treinado que você publica pra servir previsões ou respostas. Carrega os parâmetros aprendidos.Deploy de modelo, versionamento de artefato e dimensionamento de storage
TrainingBatch jobProcesso de ensinar o modelo com dados e ajustar parâmetros. É longo e costuma gastar muita GPU.Provisionamento de cluster com GPU, estimativa de duração de job e planejamento de pico de compute
InferenceAPI endpointExecução do modelo treinado em dados novos pra gerar resposta ou previsão.Toda chamada ao serviço em produção. É a parte que você monitora e escala
LLMServiço de texto de propósito geralModelo de linguagem treinado em volume grande de texto pra entender e gerar linguagem natural.Azure OpenAI, planejamento de quota, troubleshooting de token e latência
Fine-tuningCustomização de configuraçãoAjuste de um modelo pré-treinado usando dado do seu domínio.Quando o time precisa adaptar terminologia, estilo ou tarefa específica
Foundation ModelBase imageModelo base, grande e pré-treinado, usado como ponto de partida pra várias tarefas.Escolha do modelo inicial em quase todo projeto de AI
Parameters / WeightsValores de configuraçãoValores numéricos internos que definem como o modelo processa entrada e gera saída. Fabricantes muitas vezes não divulgam o total exato.Conta de memória, compute e storage
EpochPassada completa no datasetUma passagem completa por todo o dataset de treino. Em fine-tuning isso aparece bastante; em pretraining grande a conversa costuma ser em tokens.Estimativa de duração e custo de treino
Batch SizeTamanho do loteQuantidade de amostras processadas antes de atualizar os pesos. Quanto maior, mais memória consome.Ajuste de treino e troubleshooting de OOM
Transfer LearningReuso de templateUso de um modelo já treinado como base pra outra tarefa, reaproveitando conhecimento.Projeto que quer resultado mais rápido sem começar do zero

Dados e armazenamento

Termo AIAnalogia de infraDefiniçãoQuando aparece
DatasetFonte de dados ou volumeConjunto de dados estruturados ou não usados pra treinar, validar ou testar um modelo.Storage, pipeline de dados e controle de acesso
EmbeddingChave de índice semânticoRepresentação vetorial de texto, imagem ou outro conteúdo que preserva significado.RAG, busca por similaridade e banco vetorial
TokenizationSerializaçãoQuebra do texto em tokens que o modelo consegue processar.Conta de custo, uso de janela de contexto e otimização de prompt
Vector DatabaseÍndice de buscaBanco especializado em armazenar embeddings e buscar por similaridade.Arquitetura RAG e Azure AI Search com vetor
Feature StoreCamada de cache pra featuresRepositório centralizado de features pré-computadas pra treino e inferência.Plataforma de ML com reuso e baixa latência
Data DriftMudança na distribuição de entradaQuando os dados de produção deixam de parecer com os dados de treino e a qualidade cai.Modelo degrada sem mudança de código

Compute e hardware

Termo AIAnalogia de infraDefiniçãoQuando aparece
GPUCoprocessadorProcessador desenhado pra computação paralela massiva, muito bom em multiplicação de matriz.Escolha de VM, observabilidade e custo
CUDAPlataforma e SDK de GPUPlataforma de computação paralela da NVIDIA que permite rodar código na GPU.Driver, container com GPU e troubleshooting de memória
HBMRAM da GPUMemória de alta largura de banda empilhada junto da GPU. Uma A100 de 80 GB usa HBM2e.Escolha de SKU, porque o tamanho do modelo depende bastante disso
InfiniBandRede de alta velocidade entre nósInterconexão de baixa latência e alta banda pra treino distribuído.Cluster multi-node com GPU, em especial em séries ND
NVLinkLink GPU a GPUInterconexão rápida entre GPUs do mesmo host. Entrega banda bem maior que PCIe, mas a diferença exata depende da geração.VM com múltiplas GPUs e workloads com paralelismo de modelo
Tensor CoreUnidade especializada de multiplicação de matrizBloco de hardware da NVIDIA otimizado pra operações que dominam AI.Comparação entre gerações de GPU

Operação de modelos

Termo AIAnalogia de infraDefiniçãoQuando aparece
CheckpointSnapshot ou backupEstado salvo do treino, incluindo pesos, estado do otimizador e progresso.Retomada de treino e planejamento de storage
GradientSinal de erroValor matemático que aponta direção e magnitude do ajuste necessário nos pesos.Diagnóstico de instabilidade, como exploding ou vanishing gradients
HyperparameterConfig tunávelValor definido antes do treino, como learning rate ou batch size.Grade de experimentos e múltiplos runs
MLOpsDevOps pra modeloAplicação de versionamento, CI/CD, observabilidade e automação ao ciclo de vida de ML.Plataforma de ML e pipeline de promoção de modelo
Model RegistryRegistry de artefatoRepositório versionado pra armazenar e promover modelos treinados.Rollback, promoção entre ambientes e governança

Deploy e serving

Termo AIAnalogia de infraDefiniçãoQuando aparece
PromptCorpo do requestTexto enviado ao modelo com instrução, contexto e pergunta.Toda interação com LLM
CompletionCorpo da respostaSaída gerada pelo modelo em resposta ao prompt.Parsing, custo e avaliação de qualidade
Context WindowTamanho máximo do payloadTotal de tokens que o modelo consegue processar em uma chamada, somando prompt e resposta.Desenho de prompt e arquitetura RAG
Inference EndpointAPI de produçãoEndpoint HTTP que recebe entrada e devolve previsão ou texto gerado.Escala, SLO e observabilidade
PTUCapacidade reservadaCapacidade reservada no Azure OpenAI. Dá throughput e latência mais previsíveis dentro da capacidade comprada.Workload estável que precisa de previsibilidade
RAGEnriquecimento dinâmico do promptPadrão que busca conteúdo relevante e injeta no prompt antes da geração.Chat corporativo, busca em documento e AI com dado atualizado
TPMQuota de throughputMáximo de tokens processados por minuto em um deployment.Sizing, custo e troubleshooting de 429
RPMQuota de requestsMáximo de chamadas por minuto em um deployment.Capacidade e limitação de taxa

Conceitos avançados

Termo AIAnalogia de infraDefiniçãoQuando aparece
Data ParallelismSharding de dado entre GPUsEstratégia em que cada GPU processa um batch diferente com uma cópia completa do modelo.Escala horizontal de treino
Model ParallelismSharding do modeloDivisão do modelo entre várias GPUs quando ele não cabe em uma só.Modelos muito grandes, como 70B ou mais
LoRAFine-tuning leveTécnica que treina um conjunto pequeno de adaptadores em vez do modelo inteiro.Customização mais barata de foundation model
Mixed PrecisionOtimização por tipo de dadoUso combinado de FP32 com BF16 ou FP16 pra reduzir memória e aumentar throughput.Treino em GPU moderna
QuantizationCompressãoRedução da precisão numérica do modelo, como FP32 pra INT8 ou INT4, pra baixar custo e acelerar inferência.Deploy com restrição de memória ou latência
Prompt InjectionInjeção de instrução maliciosaAtaque em que entrada não confiável tenta sobrescrever a instrução do sistema e desviar o comportamento do modelo.Segurança de aplicação com LLM exposto a usuário
ZeROOtimização de memória distribuídaConjunto de técnicas que reparte estados do otimizador, gradientes e parâmetros entre GPUs pra reduzir redundância.Treino distribuído com modelo grande demais pra memória disponível

Referência rápida: 20 termos

Guarda esse quadro. Ele poupa tempo.

#Termo AITradução infra
1ModelBinário treinado e publicável
2TrainingBatch job que produz o modelo
3InferenceChamada em tempo real a um modelo publicado
4GPUCoprocessador pra matemática paralela
5LLMServiço de texto de propósito geral
6PromptCorpo do request
7CompletionCorpo da resposta
8TokenUnidade mínima de processamento e cobrança
9Context WindowTamanho máximo do payload
10Fine-tuningAjuste do modelo base com dado do seu domínio
11RAGPrompt enriquecido com dado buscado externamente
12EmbeddingChave vetorial pra busca semântica
13CheckpointSnapshot do treino
14TPMQuota de tokens por minuto
15PTUCapacidade reservada no Azure OpenAI
16CUDAPlataforma e SDK de GPU da NVIDIA
17LoRAFine-tuning com adaptadores pequenos
18MLOpsDevOps aplicado ao ciclo de vida do modelo
19Data DriftDado de produção mudou e o modelo piorou
20QuantizationCompressão do modelo pra gastar menos memória

Leitura complementar

Encerramento da série

Foram 15 posts. Do primeiro conceito, que era por que engenheiro de infra importa pra AI, até este glossário. Se você chegou até aqui, já tem base pra conversar com data scientist, arquiteto, segurança e finanças sem tratar AI como truque de palco.

O livro completo, em inglês, continua disponível de graça em ai4infra.com. Se esta série em português te poupou algumas horas de tropeço, manda pra outro profissional de infra que caiu em projeto de AI sem ter pedido muito.

AI não apaga o que você já sabe. Ela exige isso. Rede, storage, compute, segurança, automação, custo e resposta a incidente continuam no centro. Agora você só ganhou um vocabulário melhor pra ligar uma coisa na outra.