LLM-as-a-judge
Usar um modelo para avaliar as respostas de outro modelo segundo critérios definidos.
Útil para avaliar em escala critérios difíceis de medir com regra fixa (relevância, tom, fidelidade à fonte).
A real: o juiz também erra e tem vieses. Calibre-o contra avaliações humanas antes de confiar nele.
Veja também: Eval (avaliação de LLM), Golden dataset