INSTITUTO PORTUGUÊSINTELIGÊNCIA ARTIFICIALGlossário ←
Início→Glossário→RLHF (Reinforcement Learning from Human Feedback)
§ Técnicas

RLHF (Reinforcement Learning from Human Feedback)

Também conhecido como: aprendizagem por reforço com feedback humano

RLHF é a técnica que tornou os LLMs «utilizáveis». Depois do pré-treino, humanos comparam pares de respostas e indicam qual prefere. Um modelo de recompensa aprende essa preferência e guia o LLM via aprendizagem por reforço. Resultado: respostas mais úteis, menos tóxicas, mais alinhadas com expectativas humanas. Foi o que transformou GPT-3 (apenas autocomplete) em ChatGPT (assistente conversacional). Alternativas modernas: DPO, RLAIF.

Termos relacionados
  • Fine-tuning
  • Modelo base (Foundation Model)
Aprender RLHF (Reinforcement Learning from Human Feedback) na prática

O Instituto Português de IA ensina este e outros temas em formações estruturadas com projetos. Começa pelo curso gratuito (48 aulas).