Pular para o conteúdo
Felipe CoutinhoData Unicorn

LLM-as-a-judge

Usar um modelo para avaliar as respostas de outro modelo segundo critérios definidos.

Útil para avaliar em escala critérios difíceis de medir com regra fixa (relevância, tom, fidelidade à fonte).

A real: o juiz também erra e tem vieses. Calibre-o contra avaliações humanas antes de confiar nele.

Veja também: Eval (avaliação de LLM), Golden dataset