Eval (avaliação de LLM)
Conjunto de testes que mede se o seu sistema com LLM responde bem, e se continua respondendo bem depois de cada mudança.
Evals são os testes automatizados do mundo dos LLMs. Sem eles, trocar de modelo, de prompt ou de estratégia de RAG é apostar no escuro: você pode quebrar 15% das respostas que estavam boas sem perceber.
Veja também: Golden dataset, LLM-as-a-judge, RAG (Retrieval-Augmented Generation)