§ Fundamentos
Inferência
Também conhecido como: inference · predição
Inferência é o processo de correr um modelo de IA treinado para obter uma saída — o oposto de treinar. Custos: dominados por compute (GPU). Em produção, 95% do custo de um SaaS com IA é inferência, não treino. Otimizações comuns: quantização (FP16, INT8, INT4), batching, KV cache, speculative decoding. Provedores de inferência especializados em 2026: Groq (LPU custom, ultra-rápido), Together, Fireworks, Cerebras.
Termos relacionados
Aprender Inferência na prática
O Instituto Português de IA ensina este e outros temas em formações estruturadas com projetos. Começa pelo curso gratuito (48 aulas).