Avaliação de LLMs em Produção: Métricas e Frameworks em 2026
Como avaliar LLMs em produção em 2026: golden set, LLM-as-judge, métricas de RAG, regressão. Frameworks e cadência recomendada.
Modelos sem avaliação contínua viram caixa-preta em queda livre. Avaliação de LLMs em produção não é luxo: é o que separa um produto que melhora a cada release de um que regride sem ninguém perceber. Este guia traz os métodos que sustentam qualidade ao longo do tempo.
Camadas de avaliação
- Offline: golden set, regressão por release, comparativo entre modelos.
- Online: A/B test, métricas de produto, sinais implícitos do usuário.
- Contínua: monitoramento de drift, sampling de tráfego real, alertas.
Golden set
Conjunto curado de exemplos representativos com saída esperada. Versionado como código, revisado por especialistas, rodado a cada mudança de prompt, modelo ou ferramenta. Tamanho mínimo útil: 50 a 200 exemplos por caso de uso. Sem golden set, qualquer "melhoria" é ato de fé.
LLM como juiz
Padrão dominante em 2026: usar um modelo (geralmente diferente do testado) para avaliar respostas segundo rubricas. Funciona bem para qualidade, fidelidade ao contexto e tom. Cuidados: vieses do juiz, calibração contra humano em amostra, troca periódica de juiz para evitar cumplicidade.
Métricas específicas de RAG
| Métrica | O que mede |
|---|---|
| Context recall | Cobertura da informação necessária no contexto recuperado |
| Context precision | Fração do contexto que é realmente útil |
| Faithfulness | Resposta está fundamentada no contexto, sem inventar |
| Answer relevance | Resposta endereça a pergunta de fato |
Métricas de agentes
- Taxa de conclusão da tarefa.
- Número médio de passos por tarefa concluída.
- Taxa de uso correto de ferramenta.
- Custo por tarefa concluída.
- Tempo até resposta útil.
Frameworks práticos
Open source: Ragas (RAG), DeepEval (testes unitários para LLM), Phoenix (observabilidade). Gerenciados: Braintrust, LangSmith, Helicone. A escolha depende de stack, integração e privacidade dos dados.
Cadência recomendada
Por release: golden set + regressão automatizada bloqueando merge se cair acima de limiar. Diário: amostragem aleatória de produção avaliada por LLM-as-judge. Semanal: revisão humana de amostra + análise de outliers. Mensal: revisão do golden set.
Erros comuns
- Avaliar só com benchmarks públicos, ignorando o uso real do produto.
- Subestimar viés do LLM-as-judge em respostas longas e bem escritas.
- Não calibrar avaliação automática contra revisão humana periódica.
Próximos passos
A WSS estrutura avaliação contínua dentro de projetos de implementação de IA. Para a base de plataforma, veja MLOps no Brasil.