§ Técnicas
RLHF (Reinforcement Learning from Human Feedback)
Também conhecido como: aprendizagem por reforço com feedback humano
RLHF é a técnica que tornou os LLMs «utilizáveis». Depois do pré-treino, humanos comparam pares de respostas e indicam qual prefere. Um modelo de recompensa aprende essa preferência e guia o LLM via aprendizagem por reforço. Resultado: respostas mais úteis, menos tóxicas, mais alinhadas com expectativas humanas. Foi o que transformou GPT-3 (apenas autocomplete) em ChatGPT (assistente conversacional). Alternativas modernas: DPO, RLAIF.
Termos relacionados
Aprender RLHF (Reinforcement Learning from Human Feedback) na prática
O Instituto Português de IA ensina este e outros temas em formações estruturadas com projetos. Começa pelo curso gratuito (48 aulas).