§ Fundamentos
Benchmark (de modelos)
Um benchmark é um conjunto-teste padronizado para comparar a performance de modelos de IA em tarefas específicas. Principais em 2026: MMLU (conhecimento geral), HumanEval/SWE-bench (programação), GSM8K/MATH (matemática), HellaSwag (raciocínio comum), AIME (competições matemáticas avançadas), ARC-AGI (raciocínio abstrato). Cuidado: benchmarks são frequentemente contaminados (modelo treinou nos dados) e não refletem perfeitamente uso real. Cross-checar com casos práticos da tua aplicação.
Termos relacionados
Aprender Benchmark (de modelos) na prática
O Instituto Português de IA ensina este e outros temas em formações estruturadas com projetos. Começa pelo curso gratuito (48 aulas).