Em poucos minutos

O essencial deste guia

  • Avalie a tarefa e o sistema que o usuário realmente utiliza, não apenas o modelo isolado ou uma demonstração favorável.
  • Defina critérios e limites de aprovação antes de olhar os resultados para reduzir julgamento por impressão.
  • Use casos reais, difíceis, não respondíveis e adversariais; preserve uma parte sem uso no desenvolvimento.
  • Combine verificações determinísticas, especialistas humanos e avaliadores por IA, calibrando cada método contra evidência.
  • Compare versões de forma cega e pareada, analise falhas por segmento e transforme incidentes de produção em testes de regressão.

O que significa avaliar uma resposta de IA

Avaliação é um processo estruturado para determinar se a saída atende a um objetivo no contexto real. Ela compara comportamento observado com critérios previamente definidos. Pode examinar uma resposta, uma coleção de casos ou o fluxo completo com recuperação, ferramentas, regras e revisão humana.

Benchmark público mede capacidades gerais em condições próprias; não responde automaticamente se um produto serve para sua equipe, idioma, documentos e riscos. Uma avaliação local — frequentemente chamada de eval — transforma requisitos do uso em testes reproduzíveis.

Como a geração é variável, uma demonstração não basta. A mesma entrada pode produzir versões diferentes e uma mudança de modelo ou prompt pode melhorar uma dimensão e piorar outra. Avaliar é uma atividade contínua de produto, engenharia, domínio e governança.

ObjetoPerguntaExemplo
Modelo isoladoQual capacidade geral ele demonstra?Raciocínio ou conhecimento em benchmark
PromptA instrução produz o comportamento esperado?Classificar chamados com os rótulos corretos
ComponenteRecuperação ou ferramenta funciona?Encontrar o trecho certo do manual
SistemaO fluxo completo entrega resultado seguro?Responder, citar e encaminhar corretamente
ImpactoO uso melhora o processo sem dano indevido?Reduzir tempo mantendo qualidade e equidade

Defina tarefa, usuário e decisão de lançamento

Comece com uma promessa observável: “extrair valor e vencimento de notas brasileiras”, “resumir atas sem criar decisões” ou “responder dúvidas apenas com o manual vigente”. Evite objetivos abstratos como “ser inteligente” ou “responder bem”.

Descreva população de entradas, usuários, ambiente, frequência e consequência de erro. Defina também o propósito da avaliação: comparar modelos, aprovar uma alteração, selecionar ferramenta, estabelecer linha de base ou monitorar produção.

Escreva o critério de decisão antes da execução. Pode haver requisitos eliminatórios — nenhuma exposição de dado sensível — e metas graduais — pelo menos 90% de completude. Sem regra prévia, é fácil escolher a versão preferida e justificar depois.

Contrato de avaliação

Tarefa: [comportamento]. Usuários e entradas: [população]. Ambiente: [interface, fontes e ferramentas]. Riscos críticos: [lista]. Critérios eliminatórios: [limites]. Métricas e metas: [valores]. Conjunto de teste: [origem e segmentos]. Decisão: aprovar somente se nenhum requisito crítico regredir e as metas forem atingidas.

Escolha dimensões de qualidade

Qualidade é multidimensional. Correção factual pode ser essencial em pesquisa; fidelidade é central em resumo; precisão e recall importam em classificação; utilidade e tom pesam no atendimento. Custo e latência também afetam o produto. Não comprima tudo em uma nota sem entender os componentes.

Defina cada dimensão em linguagem observável. “Clareza” pode significar termos explicados, frases diretas e sequência lógica. “Segurança” pode significar recusar instrução perigosa, não revelar dados e escalar casos. Uma dimensão vaga produz avaliações inconsistentes.

Determine pesos e requisitos mínimos conforme o risco. Um sistema não deve compensar uma violação grave de privacidade com excelente estilo. Use portões eliminatórios e depois uma pontuação composta apenas para os aspectos comparáveis.

DimensãoO que observar
CorreçãoFatos, cálculos, rótulos e conclusões corretos
FidelidadeA saída permanece apoiada nas fontes e instruções
CompletudeCobre os elementos necessários sem omissões críticas
RelevânciaResponde à pergunta sem desvio ou excesso
ConsistênciaMantém formato e decisão em casos equivalentes
SegurançaRespeita privacidade, autorização e limites de uso
EquidadeDesempenho e tratamento por grupos relevantes
OperaçãoLatência, custo, disponibilidade e necessidade de revisão

Monte um conjunto de testes representativo

O conjunto deve refletir a distribuição real e também situações de alto risco. Combine amostras sanitizadas de produção, casos elaborados por especialistas, erros históricos e exemplos sintéticos revisados. Documente origem, permissão e versão.

Inclua casos normais, raros, limítrofes, ambíguos, vazios, longos, multilíngues, não respondíveis e adversariais. Para cada segmento, defina quantidade suficiente para enxergar padrões. Se apenas casos fáceis entram no teste, a taxa final será enganosa.

Separe desenvolvimento, validação e teste. Ajustar o prompt repetidamente sobre os mesmos itens causa sobreajuste: a versão aprende aqueles exemplos, não a tarefa. Preserve um conjunto oculto ou novo para a decisão final e verifique possível contaminação com dados de treinamento quando relevante.

  • Entradas frequentes de usuários reais, devidamente autorizadas e anonimizadas.
  • Casos em que a resposta correta é declarar ausência ou pedir contexto.
  • Erros que já chegaram ao suporte ou causaram incidente.
  • Grupos, idiomas, dispositivos e formatos relevantes.
  • Tentativas de quebrar regras, injetar instruções ou obter dados.
  • Mudanças de fonte, versão, data e ferramenta.
  • Casos de referência mantidos fora da etapa de ajuste.

Construa referências e rubricas confiáveis

Algumas tarefas possuem resposta objetiva: rótulo correto, valor extraído, consulta executável. Outras admitem várias respostas boas. Nesse caso, use rubrica com critérios, níveis e exemplos. A referência deve representar requisito, não preferência de um único avaliador.

Especialistas de domínio devem criar ou validar o padrão quando o conteúdo exige competência. Registre fontes e justificativa; referência também pode estar errada ou desatualizada. Para perguntas abertas, aceite múltiplas formulações e avalie propriedades da resposta.

Uma rubrica eficaz descreve o que separa notas. Em vez de “1 a 5 para qualidade”, defina: 1 contém erro crítico; 3 responde ao núcleo, mas omite elemento relevante; 5 está correta, completa, apoiada e adequada ao público. Dê precedência explícita a falhas eliminatórias.

Rubrica resumida para resposta baseada em documento

CORREÇÃO: todas as alegações coincidem com a fonte. FIDELIDADE: nenhuma informação externa é apresentada como fato. COMPLETUDE: cobre os três requisitos da pergunta. CITAÇÃO: cada alegação principal aponta para trecho relevante. ABSTENÇÃO: se a fonte não contiver a resposta, declara ausência. Qualquer citação inventada torna o caso reprovado.

Combine diferentes tipos de avaliador

Verificações por código são rápidas e reproduzíveis: igualdade exata, presença de campo, validade de JSON, execução de teste, comparação numérica e regra de negócio. Use-as quando a propriedade é objetiva. Uma correspondência literal pode penalizar respostas semanticamente equivalentes, portanto escolha a métrica conforme a tarefa.

Avaliação humana capta nuance, utilidade, contexto e risco. É indispensável em texto aberto e áreas especializadas, mas custa mais e varia entre pessoas. Treine avaliadores, forneça rubrica, exemplos e mecanismo de desempate.

Um modelo avaliador escala julgamentos complexos, porém também apresenta vieses, erros e preferência por estilo. Calibre-o contra especialistas, exija saída estruturada com justificativa e audite amostras. Nenhum único método deve decidir sozinho em alto risco.

MétodoMelhor usoPrincipal limitação
Código/regraFormato, cálculo, rótulo e execuçãoPouca tolerância a variação semântica
Métrica textualSemelhança e cobertura em escalaPode não refletir utilidade ou verdade
Especialista humanoNuance, risco e adequação de domínioCusto, tempo e variabilidade
UsuárioUtilidade no fluxo realFeedback seletivo e contexto incompleto
Modelo avaliadorRubricas abertas em grande volumeViés, instabilidade e erro compartilhado

Faça comparação cega, pareada e calibrada

Para comparar duas versões, mostre respostas sem nome do fornecedor e varie a ordem. Avaliação pareada — escolher A, B ou empate no mesmo caso — costuma ser mais consistente do que atribuir notas absolutas. Preserve entradas e condições iguais.

Meça concordância entre avaliadores e discuta divergências. Se especialistas discordam muito, a rubrica ou a tarefa pode estar ambígua. Uma rodada de calibração com exemplos comentados melhora consistência sem forçar consenso artificial.

Não revele preço, marca ou versão quando isso puder influenciar o julgamento de qualidade. Depois, analise custo e latência em camada separada. Registre conflitos de interesse e quem tomou a decisão final.

  1. Sortear ordem das respostas e ocultar identificação.
  2. Aplicar a mesma rubrica e interface a todos os avaliadores.
  3. Permitir empate e marcação de caso inválido.
  4. Medir concordância e revisar divergências importantes.
  5. Repetir amostra para detectar instabilidade.
  6. Abrir identidade somente após concluir o julgamento.

Entenda métricas e denominadores

Acurácia é a proporção de casos corretos, mas pode enganar em classes raras. Precisão responde quantos itens marcados como positivos eram realmente positivos; recall responde quantos positivos reais foram encontrados; F1 equilibra os dois. Use matriz de confusão para enxergar trocas entre classes.

Em extração, avalie campo a campo e considere tolerância numérica. Em código, execute testes e meça proporção de tarefas aprovadas. Em respostas abertas, combine rubrica, fidelidade, completude e taxa de erro factual. Para comparação pareada, use taxa de vitória e empate.

Sempre apresente tamanho da amostra, intervalo de confiança quando aplicável e resultados por segmento. Diferença de um ponto em vinte casos pode ser ruído. Pondere severidade: média alta não compensa um erro catastrófico raro.

MétricaUsoCuidado
AcuráciaClassificação equilibradaEsconde classe rara
PrecisãoCusto de falso positivo altoPode reduzir cobertura
RecallCusto de perder um positivo altoPode aumentar alarmes falsos
F1Equilibrar precisão e recallNão incorpora custo real do erro
Exact matchFormato ou resposta objetivaPenaliza equivalência válida
Taxa de vitóriaComparação pareadaDepende de rubrica e ordem
Custo por caso aprovadoDecisão operacionalInclua revisão e retrabalho

Avalie o uso correto de recusas e incerteza

Uma resposta não é boa apenas porque tenta ajudar. Em perguntas sem evidência, ação não autorizada ou risco fora do escopo, recusar, pedir contexto ou encaminhar pode ser o comportamento correto. Inclua esses casos no conjunto.

Meça falsa aceitação — responder quando deveria se abster — e falsa recusa — negar quando havia resposta permitida. O equilíbrio depende do custo de cada erro. Um sistema médico e um gerador de slogans terão limites diferentes.

Avalie também a qualidade da recusa: explica o limite sem inventar, oferece alternativa segura e não revela informação proibida. Recusas excessivamente genéricas deterioram utilidade e confiança.

Cuidados ao usar IA como avaliadora

Modelos avaliadores podem preferir respostas mais longas, uma posição na ordem, o próprio estilo ou texto com aparência de autoridade. Podem ser enganados por instruções presentes na resposta e repetir o mesmo erro factual do sistema avaliado.

Mitigue com rubrica específica, saída estruturada, ordem aleatória, avaliações independentes e referência fornecida. Use um modelo adequado e registre versão. Compare julgamentos com especialistas em amostra representativa e reavalie quando a tarefa mudar.

Peça uma classificação e evidência curta, não raciocínio secreto extenso. Isole a resposta do candidato como dado, evitando que ela altere a instrução do avaliador. Para portões críticos, mantenha regra determinística ou aprovação humana.

Atenção: Uma nota gerada por outro modelo não é verdade objetiva. Ela é uma medição que precisa de validade, calibração e auditoria.

Avalie RAG, agentes e sistemas multimodais

Em RAG, separe recuperação e geração. Meça se o trecho necessário apareceu, em qual posição, se documentos irrelevantes foram incluídos, se a resposta permaneceu fiel e se a citação sustenta a alegação. Um resultado final errado pode ter origem no índice, na busca ou no modelo.

Em agentes, avalie resultado e trajetória: ferramenta escolhida, argumentos, sequência, permissões, tratamento de falha, número de etapas e confirmação humana. Uma tarefa concluída por caminho inseguro não deve ser aprovada. Registre traces ou logs suficientes para diagnóstico.

Em imagem, áudio e vídeo, examine aderência ao pedido, qualidade perceptual, texto, anatomia, identidade, sincronização, acessibilidade e direitos. Multimodalidade exige avaliadores e métricas específicos; não reduza tudo a uma nota textual.

SistemaComponenteFalha a isolar
RAGRecuperaçãoTrecho correto não foi encontrado
RAGGeraçãoFonte correta foi usada de modo infiel
AgentePlanejamentoEtapa ou ferramenta inadequada
AgenteExecuçãoArgumento incorreto ou permissão excessiva
MultimodalPercepçãoObjeto, voz ou texto interpretado errado
MultimodalGeraçãoSaída não atende composição, identidade ou direito

Compare versões sem confundir melhoria com acaso

Execute as versões nos mesmos casos e condições. Controle prompt, modelo, parâmetros, ferramentas, fontes e data. Se a saída varia, repita execuções em amostra e registre a distribuição, não apenas a melhor tentativa.

Analise ganhos e regressões por caso e segmento. Uma média melhor pode esconder piora em português, documentos longos ou uma classe crítica. Use intervalos de confiança ou testes estatísticos quando o volume justificar e complemente com inspeção de erros.

Considere qualidade, latência, custo, disponibilidade e esforço de revisão. A alternativa mais barata por chamada pode exigir mais correção; calcule custo por resultado aprovado. Registre a decisão e o motivo.

Tabela mínima de comparação

Para cada versão, registre: aprovação total; erros críticos; correção por segmento; fidelidade; abstenção correta; latência mediana e percentil alto; custo; minutos de revisão. Destaque casos que mudaram de aprovado para reprovado e vice-versa.

Transforme avaliação em processo contínuo

Execute avaliações antes de lançar e após mudança de modelo, prompt, fonte, ferramenta ou regra. Mantenha uma suíte rápida para cada alteração e uma avaliação ampla em marcos importantes. Versione casos, referências, rubricas e resultados.

Em produção, monitore feedback, correções humanas, abandonos, escalonamentos, recusas, incidentes, custo e latência. Amostre respostas para auditoria com proteção de dados. Logs reais ajudam a descobrir casos que o laboratório não antecipou.

Cada erro importante deve produzir diagnóstico, correção e teste de regressão. Revise periodicamente casos antigos: fontes, políticas e expectativas mudam. Avaliação contínua não significa vigiar pessoas; colete somente o necessário e cumpra privacidade e retenção.

  1. Executar linha de base antes de alterar o sistema.
  2. Comparar candidato no mesmo conjunto e condições.
  3. Revisar falhas críticas e segmentos vulneráveis.
  4. Aplicar portões de lançamento e registrar aprovação.
  5. Monitorar sinais reais e revisar amostras autorizadas.
  6. Adicionar incidentes sanitizados à suíte de regressão.
  7. Reavaliar após mudanças e em calendário definido.

Governança, documentação e responsabilidade

Uma ficha de avaliação deve identificar finalidade, proprietário, versões, dados, critérios, resultados, limitações, decisão e data. Documente quem criou a referência, quem julgou, quais conflitos existem e onde o sistema não foi testado.

Resultados devem ser comunicados sem exagero. “92% de acurácia” precisa de tarefa, população, amostra e intervalo; não significa 92% de verdade em qualquer pergunta. Declare falhas conhecidas e condições de uso.

Defina quem pode aprovar alteração, suspender o recurso e responder a incidente. Em alto risco, envolva especialistas, segurança, jurídico, privacidade e pessoas afetadas. Avaliação técnica não substitui análise de impacto social e legal.

Roteiro completo para sua primeira avaliação

Comece pequeno, mas útil: uma tarefa, algumas dezenas de casos de alta qualidade e critérios claros. Aprofunde depois com novos segmentos e automação. O conjunto precisa ser confiável o suficiente para orientar decisão, não grande apenas para parecer científico.

Revise erros individualmente. A finalidade de uma avaliação não é produzir um placar, mas descobrir onde o sistema falha e qual mudança tem maior impacto. Preserve a linha de base para saber se a correção realmente melhorou.

  1. Escolher uma promessa concreta do produto.
  2. Definir dimensões, riscos, metas e portões eliminatórios.
  3. Reunir casos normais, difíceis, ausentes e adversariais.
  4. Criar referências e rubrica com especialista quando necessário.
  5. Combinar regras automáticas, avaliação humana e IA calibrada.
  6. Executar versões de modo cego, pareado e reproduzível.
  7. Analisar métricas, falhas, segmentos, custo e latência.
  8. Decidir, documentar e criar testes de regressão.
  9. Monitorar produção e ampliar a suíte continuamente.
Dúvidas comuns

Perguntas frequentes

Quantos casos são necessários para avaliar uma IA?

Não há número universal. Comece com casos de alta qualidade que cubram o risco e aumente até obter estimativas estáveis por segmento. Informe sempre o tamanho e as limitações da amostra.

Uma nota de benchmark mostra qual IA é melhor?

Só para as tarefas e condições daquele benchmark. Para escolher uma ferramenta, teste seu idioma, seus dados, seu fluxo, seus riscos, custo e contrato.

Posso usar outra IA para corrigir as respostas?

Pode ajudar a escalar, mas precisa de rubrica e calibração contra especialistas. O avaliador também erra, tem vieses e pode ser influenciado pela ordem ou pelo estilo.

Avaliação humana é sempre superior?

Não. Regras automáticas são melhores para propriedades objetivas e reproduzíveis. Humanos são essenciais para nuance e risco. A melhor combinação depende do critério.

Como comparar dois modelos de forma justa?

Use os mesmos casos e condições, oculte a identidade, alterne a ordem, permita empate, repita quando houver variação e analise resultados pareados por segmento.

Acurácia é suficiente?

Raramente. Ela pode esconder classe rara, gravidade e falhas de segurança. Combine métricas de tarefa, fidelidade, abstenção, equidade, custo, latência e revisão.

Quando devo repetir a avaliação?

Após mudar modelo, prompt, fonte, ferramenta, política ou dados e periodicamente em produção. Incidentes e novos casos de uso também exigem atualização.

Fontes e referências

Conteúdo educacional baseado nas fontes abaixo. Tecnologias, regras e serviços mudam; consulte sempre a versão mais recente antes de tomar decisões profissionais, jurídicas, financeiras ou de saúde.