O essencial deste guia
- Avalie a tarefa e o sistema que o usuário realmente utiliza, não apenas o modelo isolado ou uma demonstração favorável.
- Defina critérios e limites de aprovação antes de olhar os resultados para reduzir julgamento por impressão.
- Use casos reais, difíceis, não respondíveis e adversariais; preserve uma parte sem uso no desenvolvimento.
- Combine verificações determinísticas, especialistas humanos e avaliadores por IA, calibrando cada método contra evidência.
- Compare versões de forma cega e pareada, analise falhas por segmento e transforme incidentes de produção em testes de regressão.
O que significa avaliar uma resposta de IA
Avaliação é um processo estruturado para determinar se a saída atende a um objetivo no contexto real. Ela compara comportamento observado com critérios previamente definidos. Pode examinar uma resposta, uma coleção de casos ou o fluxo completo com recuperação, ferramentas, regras e revisão humana.
Benchmark público mede capacidades gerais em condições próprias; não responde automaticamente se um produto serve para sua equipe, idioma, documentos e riscos. Uma avaliação local — frequentemente chamada de eval — transforma requisitos do uso em testes reproduzíveis.
Como a geração é variável, uma demonstração não basta. A mesma entrada pode produzir versões diferentes e uma mudança de modelo ou prompt pode melhorar uma dimensão e piorar outra. Avaliar é uma atividade contínua de produto, engenharia, domínio e governança.
| Objeto | Pergunta | Exemplo |
|---|---|---|
| Modelo isolado | Qual capacidade geral ele demonstra? | Raciocínio ou conhecimento em benchmark |
| Prompt | A instrução produz o comportamento esperado? | Classificar chamados com os rótulos corretos |
| Componente | Recuperação ou ferramenta funciona? | Encontrar o trecho certo do manual |
| Sistema | O fluxo completo entrega resultado seguro? | Responder, citar e encaminhar corretamente |
| Impacto | O uso melhora o processo sem dano indevido? | Reduzir tempo mantendo qualidade e equidade |
Defina tarefa, usuário e decisão de lançamento
Comece com uma promessa observável: “extrair valor e vencimento de notas brasileiras”, “resumir atas sem criar decisões” ou “responder dúvidas apenas com o manual vigente”. Evite objetivos abstratos como “ser inteligente” ou “responder bem”.
Descreva população de entradas, usuários, ambiente, frequência e consequência de erro. Defina também o propósito da avaliação: comparar modelos, aprovar uma alteração, selecionar ferramenta, estabelecer linha de base ou monitorar produção.
Escreva o critério de decisão antes da execução. Pode haver requisitos eliminatórios — nenhuma exposição de dado sensível — e metas graduais — pelo menos 90% de completude. Sem regra prévia, é fácil escolher a versão preferida e justificar depois.
Tarefa: [comportamento]. Usuários e entradas: [população]. Ambiente: [interface, fontes e ferramentas]. Riscos críticos: [lista]. Critérios eliminatórios: [limites]. Métricas e metas: [valores]. Conjunto de teste: [origem e segmentos]. Decisão: aprovar somente se nenhum requisito crítico regredir e as metas forem atingidas.
Escolha dimensões de qualidade
Qualidade é multidimensional. Correção factual pode ser essencial em pesquisa; fidelidade é central em resumo; precisão e recall importam em classificação; utilidade e tom pesam no atendimento. Custo e latência também afetam o produto. Não comprima tudo em uma nota sem entender os componentes.
Defina cada dimensão em linguagem observável. “Clareza” pode significar termos explicados, frases diretas e sequência lógica. “Segurança” pode significar recusar instrução perigosa, não revelar dados e escalar casos. Uma dimensão vaga produz avaliações inconsistentes.
Determine pesos e requisitos mínimos conforme o risco. Um sistema não deve compensar uma violação grave de privacidade com excelente estilo. Use portões eliminatórios e depois uma pontuação composta apenas para os aspectos comparáveis.
| Dimensão | O que observar |
|---|---|
| Correção | Fatos, cálculos, rótulos e conclusões corretos |
| Fidelidade | A saída permanece apoiada nas fontes e instruções |
| Completude | Cobre os elementos necessários sem omissões críticas |
| Relevância | Responde à pergunta sem desvio ou excesso |
| Consistência | Mantém formato e decisão em casos equivalentes |
| Segurança | Respeita privacidade, autorização e limites de uso |
| Equidade | Desempenho e tratamento por grupos relevantes |
| Operação | Latência, custo, disponibilidade e necessidade de revisão |
Monte um conjunto de testes representativo
O conjunto deve refletir a distribuição real e também situações de alto risco. Combine amostras sanitizadas de produção, casos elaborados por especialistas, erros históricos e exemplos sintéticos revisados. Documente origem, permissão e versão.
Inclua casos normais, raros, limítrofes, ambíguos, vazios, longos, multilíngues, não respondíveis e adversariais. Para cada segmento, defina quantidade suficiente para enxergar padrões. Se apenas casos fáceis entram no teste, a taxa final será enganosa.
Separe desenvolvimento, validação e teste. Ajustar o prompt repetidamente sobre os mesmos itens causa sobreajuste: a versão aprende aqueles exemplos, não a tarefa. Preserve um conjunto oculto ou novo para a decisão final e verifique possível contaminação com dados de treinamento quando relevante.
- Entradas frequentes de usuários reais, devidamente autorizadas e anonimizadas.
- Casos em que a resposta correta é declarar ausência ou pedir contexto.
- Erros que já chegaram ao suporte ou causaram incidente.
- Grupos, idiomas, dispositivos e formatos relevantes.
- Tentativas de quebrar regras, injetar instruções ou obter dados.
- Mudanças de fonte, versão, data e ferramenta.
- Casos de referência mantidos fora da etapa de ajuste.
Construa referências e rubricas confiáveis
Algumas tarefas possuem resposta objetiva: rótulo correto, valor extraído, consulta executável. Outras admitem várias respostas boas. Nesse caso, use rubrica com critérios, níveis e exemplos. A referência deve representar requisito, não preferência de um único avaliador.
Especialistas de domínio devem criar ou validar o padrão quando o conteúdo exige competência. Registre fontes e justificativa; referência também pode estar errada ou desatualizada. Para perguntas abertas, aceite múltiplas formulações e avalie propriedades da resposta.
Uma rubrica eficaz descreve o que separa notas. Em vez de “1 a 5 para qualidade”, defina: 1 contém erro crítico; 3 responde ao núcleo, mas omite elemento relevante; 5 está correta, completa, apoiada e adequada ao público. Dê precedência explícita a falhas eliminatórias.
CORREÇÃO: todas as alegações coincidem com a fonte. FIDELIDADE: nenhuma informação externa é apresentada como fato. COMPLETUDE: cobre os três requisitos da pergunta. CITAÇÃO: cada alegação principal aponta para trecho relevante. ABSTENÇÃO: se a fonte não contiver a resposta, declara ausência. Qualquer citação inventada torna o caso reprovado.
Combine diferentes tipos de avaliador
Verificações por código são rápidas e reproduzíveis: igualdade exata, presença de campo, validade de JSON, execução de teste, comparação numérica e regra de negócio. Use-as quando a propriedade é objetiva. Uma correspondência literal pode penalizar respostas semanticamente equivalentes, portanto escolha a métrica conforme a tarefa.
Avaliação humana capta nuance, utilidade, contexto e risco. É indispensável em texto aberto e áreas especializadas, mas custa mais e varia entre pessoas. Treine avaliadores, forneça rubrica, exemplos e mecanismo de desempate.
Um modelo avaliador escala julgamentos complexos, porém também apresenta vieses, erros e preferência por estilo. Calibre-o contra especialistas, exija saída estruturada com justificativa e audite amostras. Nenhum único método deve decidir sozinho em alto risco.
| Método | Melhor uso | Principal limitação |
|---|---|---|
| Código/regra | Formato, cálculo, rótulo e execução | Pouca tolerância a variação semântica |
| Métrica textual | Semelhança e cobertura em escala | Pode não refletir utilidade ou verdade |
| Especialista humano | Nuance, risco e adequação de domínio | Custo, tempo e variabilidade |
| Usuário | Utilidade no fluxo real | Feedback seletivo e contexto incompleto |
| Modelo avaliador | Rubricas abertas em grande volume | Viés, instabilidade e erro compartilhado |
Faça comparação cega, pareada e calibrada
Para comparar duas versões, mostre respostas sem nome do fornecedor e varie a ordem. Avaliação pareada — escolher A, B ou empate no mesmo caso — costuma ser mais consistente do que atribuir notas absolutas. Preserve entradas e condições iguais.
Meça concordância entre avaliadores e discuta divergências. Se especialistas discordam muito, a rubrica ou a tarefa pode estar ambígua. Uma rodada de calibração com exemplos comentados melhora consistência sem forçar consenso artificial.
Não revele preço, marca ou versão quando isso puder influenciar o julgamento de qualidade. Depois, analise custo e latência em camada separada. Registre conflitos de interesse e quem tomou a decisão final.
- Sortear ordem das respostas e ocultar identificação.
- Aplicar a mesma rubrica e interface a todos os avaliadores.
- Permitir empate e marcação de caso inválido.
- Medir concordância e revisar divergências importantes.
- Repetir amostra para detectar instabilidade.
- Abrir identidade somente após concluir o julgamento.
Entenda métricas e denominadores
Acurácia é a proporção de casos corretos, mas pode enganar em classes raras. Precisão responde quantos itens marcados como positivos eram realmente positivos; recall responde quantos positivos reais foram encontrados; F1 equilibra os dois. Use matriz de confusão para enxergar trocas entre classes.
Em extração, avalie campo a campo e considere tolerância numérica. Em código, execute testes e meça proporção de tarefas aprovadas. Em respostas abertas, combine rubrica, fidelidade, completude e taxa de erro factual. Para comparação pareada, use taxa de vitória e empate.
Sempre apresente tamanho da amostra, intervalo de confiança quando aplicável e resultados por segmento. Diferença de um ponto em vinte casos pode ser ruído. Pondere severidade: média alta não compensa um erro catastrófico raro.
| Métrica | Uso | Cuidado |
|---|---|---|
| Acurácia | Classificação equilibrada | Esconde classe rara |
| Precisão | Custo de falso positivo alto | Pode reduzir cobertura |
| Recall | Custo de perder um positivo alto | Pode aumentar alarmes falsos |
| F1 | Equilibrar precisão e recall | Não incorpora custo real do erro |
| Exact match | Formato ou resposta objetiva | Penaliza equivalência válida |
| Taxa de vitória | Comparação pareada | Depende de rubrica e ordem |
| Custo por caso aprovado | Decisão operacional | Inclua revisão e retrabalho |
Avalie o uso correto de recusas e incerteza
Uma resposta não é boa apenas porque tenta ajudar. Em perguntas sem evidência, ação não autorizada ou risco fora do escopo, recusar, pedir contexto ou encaminhar pode ser o comportamento correto. Inclua esses casos no conjunto.
Meça falsa aceitação — responder quando deveria se abster — e falsa recusa — negar quando havia resposta permitida. O equilíbrio depende do custo de cada erro. Um sistema médico e um gerador de slogans terão limites diferentes.
Avalie também a qualidade da recusa: explica o limite sem inventar, oferece alternativa segura e não revela informação proibida. Recusas excessivamente genéricas deterioram utilidade e confiança.
Cuidados ao usar IA como avaliadora
Modelos avaliadores podem preferir respostas mais longas, uma posição na ordem, o próprio estilo ou texto com aparência de autoridade. Podem ser enganados por instruções presentes na resposta e repetir o mesmo erro factual do sistema avaliado.
Mitigue com rubrica específica, saída estruturada, ordem aleatória, avaliações independentes e referência fornecida. Use um modelo adequado e registre versão. Compare julgamentos com especialistas em amostra representativa e reavalie quando a tarefa mudar.
Peça uma classificação e evidência curta, não raciocínio secreto extenso. Isole a resposta do candidato como dado, evitando que ela altere a instrução do avaliador. Para portões críticos, mantenha regra determinística ou aprovação humana.
Avalie RAG, agentes e sistemas multimodais
Em RAG, separe recuperação e geração. Meça se o trecho necessário apareceu, em qual posição, se documentos irrelevantes foram incluídos, se a resposta permaneceu fiel e se a citação sustenta a alegação. Um resultado final errado pode ter origem no índice, na busca ou no modelo.
Em agentes, avalie resultado e trajetória: ferramenta escolhida, argumentos, sequência, permissões, tratamento de falha, número de etapas e confirmação humana. Uma tarefa concluída por caminho inseguro não deve ser aprovada. Registre traces ou logs suficientes para diagnóstico.
Em imagem, áudio e vídeo, examine aderência ao pedido, qualidade perceptual, texto, anatomia, identidade, sincronização, acessibilidade e direitos. Multimodalidade exige avaliadores e métricas específicos; não reduza tudo a uma nota textual.
| Sistema | Componente | Falha a isolar |
|---|---|---|
| RAG | Recuperação | Trecho correto não foi encontrado |
| RAG | Geração | Fonte correta foi usada de modo infiel |
| Agente | Planejamento | Etapa ou ferramenta inadequada |
| Agente | Execução | Argumento incorreto ou permissão excessiva |
| Multimodal | Percepção | Objeto, voz ou texto interpretado errado |
| Multimodal | Geração | Saída não atende composição, identidade ou direito |
Compare versões sem confundir melhoria com acaso
Execute as versões nos mesmos casos e condições. Controle prompt, modelo, parâmetros, ferramentas, fontes e data. Se a saída varia, repita execuções em amostra e registre a distribuição, não apenas a melhor tentativa.
Analise ganhos e regressões por caso e segmento. Uma média melhor pode esconder piora em português, documentos longos ou uma classe crítica. Use intervalos de confiança ou testes estatísticos quando o volume justificar e complemente com inspeção de erros.
Considere qualidade, latência, custo, disponibilidade e esforço de revisão. A alternativa mais barata por chamada pode exigir mais correção; calcule custo por resultado aprovado. Registre a decisão e o motivo.
Para cada versão, registre: aprovação total; erros críticos; correção por segmento; fidelidade; abstenção correta; latência mediana e percentil alto; custo; minutos de revisão. Destaque casos que mudaram de aprovado para reprovado e vice-versa.
Transforme avaliação em processo contínuo
Execute avaliações antes de lançar e após mudança de modelo, prompt, fonte, ferramenta ou regra. Mantenha uma suíte rápida para cada alteração e uma avaliação ampla em marcos importantes. Versione casos, referências, rubricas e resultados.
Em produção, monitore feedback, correções humanas, abandonos, escalonamentos, recusas, incidentes, custo e latência. Amostre respostas para auditoria com proteção de dados. Logs reais ajudam a descobrir casos que o laboratório não antecipou.
Cada erro importante deve produzir diagnóstico, correção e teste de regressão. Revise periodicamente casos antigos: fontes, políticas e expectativas mudam. Avaliação contínua não significa vigiar pessoas; colete somente o necessário e cumpra privacidade e retenção.
- Executar linha de base antes de alterar o sistema.
- Comparar candidato no mesmo conjunto e condições.
- Revisar falhas críticas e segmentos vulneráveis.
- Aplicar portões de lançamento e registrar aprovação.
- Monitorar sinais reais e revisar amostras autorizadas.
- Adicionar incidentes sanitizados à suíte de regressão.
- Reavaliar após mudanças e em calendário definido.
Governança, documentação e responsabilidade
Uma ficha de avaliação deve identificar finalidade, proprietário, versões, dados, critérios, resultados, limitações, decisão e data. Documente quem criou a referência, quem julgou, quais conflitos existem e onde o sistema não foi testado.
Resultados devem ser comunicados sem exagero. “92% de acurácia” precisa de tarefa, população, amostra e intervalo; não significa 92% de verdade em qualquer pergunta. Declare falhas conhecidas e condições de uso.
Defina quem pode aprovar alteração, suspender o recurso e responder a incidente. Em alto risco, envolva especialistas, segurança, jurídico, privacidade e pessoas afetadas. Avaliação técnica não substitui análise de impacto social e legal.
Roteiro completo para sua primeira avaliação
Comece pequeno, mas útil: uma tarefa, algumas dezenas de casos de alta qualidade e critérios claros. Aprofunde depois com novos segmentos e automação. O conjunto precisa ser confiável o suficiente para orientar decisão, não grande apenas para parecer científico.
Revise erros individualmente. A finalidade de uma avaliação não é produzir um placar, mas descobrir onde o sistema falha e qual mudança tem maior impacto. Preserve a linha de base para saber se a correção realmente melhorou.
- Escolher uma promessa concreta do produto.
- Definir dimensões, riscos, metas e portões eliminatórios.
- Reunir casos normais, difíceis, ausentes e adversariais.
- Criar referências e rubrica com especialista quando necessário.
- Combinar regras automáticas, avaliação humana e IA calibrada.
- Executar versões de modo cego, pareado e reproduzível.
- Analisar métricas, falhas, segmentos, custo e latência.
- Decidir, documentar e criar testes de regressão.
- Monitorar produção e ampliar a suíte continuamente.
Perguntas frequentes
Quantos casos são necessários para avaliar uma IA?
Não há número universal. Comece com casos de alta qualidade que cubram o risco e aumente até obter estimativas estáveis por segmento. Informe sempre o tamanho e as limitações da amostra.
Uma nota de benchmark mostra qual IA é melhor?
Só para as tarefas e condições daquele benchmark. Para escolher uma ferramenta, teste seu idioma, seus dados, seu fluxo, seus riscos, custo e contrato.
Posso usar outra IA para corrigir as respostas?
Pode ajudar a escalar, mas precisa de rubrica e calibração contra especialistas. O avaliador também erra, tem vieses e pode ser influenciado pela ordem ou pelo estilo.
Avaliação humana é sempre superior?
Não. Regras automáticas são melhores para propriedades objetivas e reproduzíveis. Humanos são essenciais para nuance e risco. A melhor combinação depende do critério.
Como comparar dois modelos de forma justa?
Use os mesmos casos e condições, oculte a identidade, alterne a ordem, permita empate, repita quando houver variação e analise resultados pareados por segmento.
Acurácia é suficiente?
Raramente. Ela pode esconder classe rara, gravidade e falhas de segurança. Combine métricas de tarefa, fidelidade, abstenção, equidade, custo, latência e revisão.
Quando devo repetir a avaliação?
Após mudar modelo, prompt, fonte, ferramenta, política ou dados e periodicamente em produção. Incidentes e novos casos de uso também exigem atualização.
Fontes e referências
Conteúdo educacional baseado nas fontes abaixo. Tecnologias, regras e serviços mudam; consulte sempre a versão mais recente antes de tomar decisões profissionais, jurídicas, financeiras ou de saúde.