Pular para o conteúdo
Felipe CoutinhoData Unicorn

RLHF

Aprendizado por reforço com feedback humano. Uma das técnicas usadas para alinhar o comportamento de um modelo ao que as pessoas preferem.

Pessoas comparam respostas, um modelo de recompensa aprende essas preferências e o LLM é ajustado para maximizá-las. Conhecer o básico ajuda a entender por que os modelos se comportam como se comportam. Raramente é requisito no dia a dia de um AI Engineer.

Veja também: Fine-tuning, LLM (Large Language Model)