INSTITUTO PORTUGUÊSINTELIGÊNCIA ARTIFICIALGlossário ←
Início→Glossário→Benchmark (de modelos)
§ Fundamentos

Benchmark (de modelos)

Um benchmark é um conjunto-teste padronizado para comparar a performance de modelos de IA em tarefas específicas. Principais em 2026: MMLU (conhecimento geral), HumanEval/SWE-bench (programação), GSM8K/MATH (matemática), HellaSwag (raciocínio comum), AIME (competições matemáticas avançadas), ARC-AGI (raciocínio abstrato). Cuidado: benchmarks são frequentemente contaminados (modelo treinou nos dados) e não refletem perfeitamente uso real. Cross-checar com casos práticos da tua aplicação.

Termos relacionados
  • LLM (Large Language Model)
  • Modelo base (Foundation Model)
Aprender Benchmark (de modelos) na prática

O Instituto Português de IA ensina este e outros temas em formações estruturadas com projetos. Começa pelo curso gratuito (48 aulas).