§ Técnicas
Quantização
Também conhecido como: quantization
Quantização é a técnica de reduzir a precisão numérica dos pesos de um modelo (de FP32/FP16 para INT8 ou INT4), tornando-o mais pequeno e mais rápido em inferência, com perda mínima de qualidade. Crítico para correr LLMs grandes em hardware modesto: um Llama 70B em FP16 precisa de 140GB de VRAM; em INT4, ~40GB — entra num único GPU de 48GB. Formatos populares: GGUF (Ollama, llama.cpp), AWQ, GPTQ.
Termos relacionados
Aprender Quantização na prática
O Instituto Português de IA ensina este e outros temas em formações estruturadas com projetos. Começa pelo curso gratuito (48 aulas).