Checklist de IA em produção
As perguntas a responder antes de colocar um sistema com LLM na frente de usuários reais.
Como usar: passe pela lista antes de cada lançamento e a cada troca de modelo. Cada item sem resposta é um risco que você está aceitando. Tudo bem aceitar, desde que seja de propósito.
Problema e escopo
- O problema está escrito em uma frase, com a métrica de negócio que ele move.
- Existe uma solução sem LLM (regra, busca,
if/else)? Ela foi descartada com motivo? - O que o sistema não deve fazer está documentado.
Qualidade
- Há um golden dataset com casos reais, incluindo os difíceis e os de borda.
- Os evals rodam automaticamente a cada mudança de prompt, modelo ou dados.
- Existe um critério mínimo de qualidade que bloqueia o deploy.
- Se usa LLM-as-a-judge, ele foi calibrado contra avaliação humana.
Custo e latência
- Custo por requisição e por usuário estimado e medido em produção.
- Limite de gasto e alerta configurados.
- Latência p95 medida; streaming ou processamento assíncrono onde o usuário espera.
- Cache e modelo menor para as tarefas simples.
Segurança e dados
- Dados sensíveis mapeados: o que vai para o provedor do modelo e sob qual contrato.
- Entrada do usuário tratada como não confiável (prompt injection), principalmente com ferramentas e agentes.
- Ferramentas com o mínimo de permissão necessária; ações irreversíveis exigem confirmação humana.
- Saídas validadas por schema antes de qualquer sistema consumir.
Operação
- Logs de entrada, saída, modelo, versão do prompt, custo e latência (respeitando privacidade).
- Plano para quando o provedor cair ou mudar o modelo: fallback, timeout e mensagem honesta ao usuário.
- Versão do modelo fixada; atualização só depois de passar nos evals.
- Canal para o usuário reportar resposta ruim, e esse feedback volta para o golden dataset.
Expectativas
- Quem pediu o sistema sabe a taxa de erro esperada, e concorda com ela.
- A demonstração para a liderança usa casos reais, não os que sempre funcionam.