INSTITUTO PORTUGUÊSINTELIGÊNCIA ARTIFICIALGlossário ←
Início→Glossário→Evals (avaliações de modelos)
§ Técnicas

Evals (avaliações de modelos)

Também conhecido como: avaliações

Evals (evaluations) são testes específicos da tua aplicação que medem se um LLM está a fazer o que precisas. Diferente de benchmarks (genéricos), evals são feitos sob medida: conjunto de inputs reais + saídas esperadas + grader (humano ou LLM). Quando trocas de modelo ou prompt, corres os evals e vês se melhoraste/regrediste. Em 2026 é prática standard em qualquer equipa séria de produto de IA. Ferramentas: OpenAI Evals, Anthropic Evals SDK, LangSmith, Braintrust.

Termos relacionados
  • Benchmark (de modelos)
  • LLM (Large Language Model)
Aprender Evals (avaliações de modelos) na prática

O Instituto Português de IA ensina este e outros temas em formações estruturadas com projetos. Começa pelo curso gratuito (48 aulas).