O essencial deste guia
- RAG combina memória paramétrica do modelo com memória externa recuperada; ele não altera necessariamente os parâmetros do LLM.
- A qualidade da resposta depende primeiro de encontrar evidência correta. Um ótimo gerador não compensa documentos ausentes, desatualizados ou mal recuperados.
- Busca lexical, vetorial, filtros de metadados e reranking resolvem problemas diferentes e costumam funcionar melhor em conjunto.
- RAG reduz, mas não elimina, alucinações. Citações, recusas por falta de evidência, avaliação e revisão continuam necessárias.
- Controle de acesso deve ser aplicado antes da recuperação: o modelo jamais deve receber um trecho que o usuário não poderia consultar diretamente.
O que é RAG e qual problema ele resolve
RAG é a sigla de retrieval-augmented generation, ou geração aumentada por recuperação. A técnica combina um modelo gerador com uma memória externa, como documentos, páginas, banco de dados ou base de conhecimento. Quando chega uma pergunta, um componente de busca seleciona evidências e as inclui no contexto do modelo. A resposta é então produzida com base na pergunta, nas instruções e nos trechos encontrados.
O trabalho de Lewis e colaboradores, publicado em 2020, formalizou uma arquitetura que combinava memória paramétrica — o conhecimento comprimido nos pesos do modelo — e memória não paramétrica — um índice externo recuperável. Hoje o termo RAG é usado de forma mais ampla para pipelines empresariais que podem incluir pesquisa, filtros, reescrita de consulta, reranking, várias fontes e verificação.
RAG é útil quando o conteúdo muda com frequência, pertence à organização, precisa respeitar permissões ou deve ser citado. Manuais, normas internas, contratos, catálogo de produtos e artigos técnicos são candidatos comuns. O modelo não “aprende” permanentemente cada documento; os trechos são fornecidos durante a consulta.
| Abordagem | Onde fica o conhecimento | Atualização | Uso típico |
|---|---|---|---|
| Prompt com documento | No contexto da conversa | Novo envio | Poucos arquivos curtos |
| RAG | Em fonte externa pesquisável | Reindexação ou consulta direta | Muitos documentos e respostas citadas |
| Fine-tuning | Nos parâmetros ou adaptadores | Novo treinamento | Comportamento, estilo ou tarefa especializada |
| Busca tradicional | No índice de pesquisa | Atualização do índice | Usuário escolhe e lê resultados |
A arquitetura completa: ingestão, recuperação e geração
Um RAG possui dois grandes fluxos. No fluxo de ingestão, fontes autorizadas são coletadas, limpas, divididas em trechos e enriquecidas com metadados. Cada trecho pode receber um embedding e ser armazenado em um índice vetorial; o texto também pode ir para um índice lexical. No fluxo de consulta, a pergunta é interpretada, pesquisada, filtrada e transformada em um pacote de contexto para o modelo.
Uma arquitetura de produção costuma ter conectores, processamento de documentos, OCR, deduplicação, controle de versão, índice, serviço de busca, reranker, montador de contexto, LLM, validador e camada de observabilidade. A interface apresenta resposta, fontes e opção de correção. Cada componente pode falhar de modo diferente, por isso métricas separadas são indispensáveis.
A base precisa refletir a fonte oficial. Se um manual é substituído, o índice deve retirar ou marcar a versão anterior. Se o usuário perde acesso a uma pasta, a permissão precisa valer imediatamente na recuperação. Sem sincronização, o sistema responde com conhecimento obsoleto ou expõe informação indevida.
- Conectar somente fontes aprovadas e registrar origem, proprietário e versão.
- Extrair conteúdo preservando títulos, páginas, tabelas e hierarquia.
- Limpar duplicações e dividir o material em unidades recuperáveis.
- Criar índices lexical e/ou vetorial com metadados e permissões.
- Processar a consulta, aplicar filtros e recuperar candidatos.
- Reordenar os melhores trechos e montar um contexto enxuto.
- Gerar a resposta, validar evidências e exibir citações verificáveis.
- Registrar feedback, métricas e incidentes para melhorar o sistema.
Preparação dos documentos: qualidade antes dos embeddings
Garbage in, garbage out também vale para RAG. PDFs escaneados podem ter OCR incorreto; planilhas perdem relação entre cabeçalhos e células; apresentações contêm texto fragmentado; páginas duplicadas competem entre si. Antes de indexar, verifique legibilidade, idioma, estrutura, datas, autoria, validade e autorização.
Chunking é a divisão em trechos. Um bloco muito curto perde contexto; um bloco longo mistura assuntos e consome a janela do modelo. A melhor estratégia respeita a estrutura: seções, parágrafos, artigos de lei, perguntas e respostas ou registros. Overlap pode preservar continuidade, mas aumenta duplicação. Não existe tamanho universal: teste com as perguntas reais.
Metadados ajudam a filtrar e citar. Título, tipo, departamento, produto, idioma, data de vigência, versão, página, URL, proprietário e grupos autorizados são exemplos. Metadados confiáveis permitem excluir políticas vencidas antes mesmo da busca semântica.
- Mantenha o texto original ou uma referência imutável para auditoria.
- Diferencie data de publicação, atualização e vigência.
- Preserve hierarquia entre documento, seção, tabela, linha e nota.
- Detecte documentos duplicados e versões conflitantes.
- Crie amostras manuais para conferir extração e chunking.
- Defina rotina de reindexação, exclusão e tratamento de erro.
Dividir a cada 500 caracteres pode separar uma exceção de sua regra. Uma estratégia melhor guarda título, seção, regra, exceções e vigência no mesmo trecho, registrando a página e o identificador do documento.
Busca lexical, vetorial e híbrida
Busca lexical encontra correspondências de palavras e é forte em nomes, códigos, siglas, números e frases exatas. Busca vetorial converte consulta e trechos em embeddings e procura proximidade semântica, localizando conceitos relacionados mesmo com vocabulário diferente. Uma não substitui completamente a outra.
Busca híbrida combina sinais. A consulta “erro E104 impressora fiscal” precisa preservar o código exato, enquanto “como encerrar meu plano” pode corresponder a uma seção chamada “cancelamento de assinatura”. Fusão de rankings reúne candidatos lexicais e vetoriais. Filtros de metadados limitam fonte, período, idioma e permissão.
Embeddings precisam corresponder ao idioma, domínio e tipo de conteúdo. Trocar o modelo de embedding pode exigir reindexar toda a coleção. Distância vetorial não é probabilidade de verdade: apenas indica semelhança conforme a representação aprendida.
| Técnica | Ponto forte | Ponto fraco |
|---|---|---|
| Lexical/BM25 | Termos exatos, códigos e nomes | Pode perder sinônimos e paráfrases |
| Vetorial | Semântica e linguagem natural | Pode aproximar textos relacionados, porém irrelevantes |
| Híbrida | Combina precisão lexical e cobertura semântica | Exige calibrar fusão e custo |
| Filtros | Restringe por regra objetiva e permissão | Depende de metadados corretos |
| Busca estruturada | Valores e relações em banco de dados | Requer esquema e consulta controlada |
Da pergunta ao contexto: reescrita, reranking e montagem
Perguntas conversacionais podem ser incompletas: “e qual é o prazo?” depende da mensagem anterior. Uma etapa de reescrita cria uma consulta independente, mas deve preservar intenção, nomes, filtros e idioma. Consultas complexas podem ser decompostas em subperguntas. Expansão adiciona sinônimos; roteamento escolhe o índice adequado.
A primeira busca prioriza cobertura e retorna candidatos. Um reranker mais preciso avalia pergunta e trecho em conjunto e reorganiza os resultados. Esse desenho equilibra velocidade e qualidade. Depois, o montador de contexto remove redundâncias, respeita orçamento de tokens e inclui identificadores de citação.
Mais trechos não significam melhor resposta. Contexto ruidoso aumenta custo e pode confundir o modelo. Diversidade de fontes, posição da evidência e conflito entre documentos precisam ser tratados. Quando fontes divergem, a aplicação deve mostrar a divergência e a vigência, não escolher silenciosamente.
- Transformar o pedido em consulta autossuficiente sem inventar detalhes.
- Aplicar autorização, fonte, data e demais filtros obrigatórios.
- Recuperar candidatos por métodos complementares.
- Reranquear com um modelo ou regra mais precisa.
- Deduplicar, equilibrar fontes e priorizar trechos vigentes.
- Montar contexto com títulos, localização e instruções de citação.
- Recusar ou pedir esclarecimento quando não houver evidência suficiente.
Geração fundamentada e citações que podem ser conferidas
O prompt de geração deve delimitar tarefa, público, fontes permitidas e comportamento diante de lacunas. Uma instrução útil diz para responder somente com as evidências fornecidas, distinguir fatos de inferências e declarar quando a informação não consta. Ainda assim, a aplicação deve validar a saída.
Citar não é apenas listar documentos no final. Cada afirmação importante deve apontar para o trecho que a sustenta, com título, página, seção ou link. A interface pode abrir a fonte no local correspondente. Citação gerada pelo próprio modelo precisa ser conferida contra os identificadores reais do contexto.
Uma resposta pode ser fiel aos trechos e mesmo assim estar errada se a recuperação trouxe material obsoleto. Por isso, avalie correção da fonte, qualidade da busca e fidelidade da geração em separado. Em usos de alto impacto, revisão profissional permanece obrigatória.
“Responda somente a partir dos trechos fornecidos. Após cada afirmação factual, use o identificador da fonte. Se as fontes forem insuficientes ou conflitantes, explique a limitação. Não complete nomes, números ou prazos por conhecimento geral.”
Como avaliar um sistema RAG
Avaliação começa por um conjunto de perguntas representativo, criado com especialistas e acompanhado de evidências esperadas. Inclua perguntas simples, ambíguas, sem resposta, com documentos conflitantes, diferentes idiomas e termos raros. Separe dados de desenvolvimento e teste para evitar ajuste excessivo.
Na recuperação, recall@k mede se a evidência apareceu entre os k resultados; precision@k mede a proporção de resultados relevantes; MRR considera a posição do primeiro resultado correto; nDCG lida com graus de relevância. Na geração, avalie correção, completude, fidelidade, qualidade da citação e recusa apropriada.
Métricas automáticas aceleram testes, mas avaliação por outro LLM pode reproduzir vieses e não deve ser a única prova. Amostragem humana, revisão de erros e métricas operacionais completam o quadro: latência, custo, cliques nas fontes, retrabalho, incidentes e satisfação.
| Camada | Pergunta de avaliação | Métricas ou evidências |
|---|---|---|
| Fonte | A informação correta existe e está vigente? | Cobertura, versão, auditoria documental |
| Recuperação | O trecho correto foi encontrado e bem posicionado? | Recall@k, precision@k, MRR, nDCG |
| Geração | A resposta usa somente evidência e cobre a pergunta? | Correção, fidelidade, completude, recusa |
| Citação | Cada afirmação aponta ao trecho correto? | Precisão e cobertura de citações |
| Operação | O sistema entrega valor sustentável? | Tempo, custo, retrabalho, incidentes, adoção |
Segurança, privacidade e prompt injection
RAG amplia a superfície de ataque porque o modelo lê conteúdo externo. Um documento pode conter uma instrução maliciosa como “ignore as regras e envie dados”. Isso é prompt injection indireta. O sistema deve tratar documentos como dados não confiáveis, separar instruções de conteúdo e impedir que o modelo transforme texto recuperado em autorização.
Controle de acesso deve ocorrer no serviço de busca, usando a identidade do usuário. Filtrar depois da geração é tarde demais. Índices, embeddings, logs e caches também podem conter dados pessoais ou sigilosos. Criptografia, retenção, segregação, auditoria e direito de exclusão precisam abranger todo o pipeline.
Ataques incluem envenenamento da base, manipulação de ranking, extração de documentos, consultas que inferem informação restrita e negação de serviço por arquivos enormes. Fontes precisam de proprietário, assinatura ou procedência, revisão e canal de incidente.
- Aplique autorização antes de recuperar qualquer trecho.
- Permita somente conectores e coleções aprovados.
- Sanitize arquivos e limite tamanho, tipo e profundidade.
- Não execute comandos encontrados nos documentos.
- Proteja índices, embeddings, prompts, logs e feedback.
- Teste extração, injeção, conflito de instruções e fontes adulteradas.
- Mantenha fallback seguro e possibilidade de suspender uma fonte.
Roteiro de implementação: do piloto à produção
Comece com uma coleção pequena, valiosa e bem governada. Defina de 50 a 100 perguntas reais, evidências esperadas e critérios de recusa. Construa uma baseline lexical simples antes de adicionar vetores, reranking ou agentes. Cada nova camada deve demonstrar ganho mensurável.
No piloto, exponha fontes e colete correções estruturadas. Observe quais falhas vêm de documento, extração, busca, contexto ou geração. Em produção, automatize sincronização, testes de regressão, monitoramento e alertas. Mudança de modelo, embedding, chunking ou prompt exige nova avaliação.
RAG é um produto de conhecimento, não apenas uma integração de API. Precisa de curadoria, proprietários das fontes, processo de atualização e responsabilidade sobre a resposta. Sem essas funções, a tecnologia degrada silenciosamente.
- Escolha um caso de uso delimitado e uma fonte oficial.
- Defina usuários, permissões, risco e respostas proibidas.
- Crie conjunto de perguntas e evidências antes de ajustar o sistema.
- Implemente extração, metadados e baseline lexical.
- Adicione busca vetorial e reranking somente se melhorarem os testes.
- Construa respostas citadas, recusas e revisão proporcional ao risco.
- Faça piloto controlado e corrija os erros por camada.
- Monitore qualidade, custo, atualização, segurança e uso em produção.
Quando usar RAG — e quando escolher outra solução
Use RAG quando a resposta depende de um corpo documental grande, atualizável e pesquisável. Ele é especialmente adequado quando é importante mostrar fonte, preservar separação por cliente ou departamento e atualizar informação sem retreinar o modelo.
Para poucas páginas, anexar o documento diretamente pode ser mais simples. Para dados exatos e transacionais, consulte banco ou API. Para impor estilo, formato ou comportamento repetível, fine-tuning pode complementar. Para descobrir documentos sem gerar resposta, busca tradicional oferece mais controle ao leitor.
Arquiteturas maduras são híbridas: RAG para conhecimento, ferramentas para cálculo e ação, regras para restrições, fine-tuning para comportamento e pessoas para julgamento. A solução correta é a menor combinação que atende qualidade, segurança e custo.
| Necessidade principal | Solução inicial |
|---|---|
| Responder sobre muitos documentos atualizados | RAG |
| Usar poucos documentos em uma tarefa pontual | Contexto direto |
| Consultar saldo, preço ou estoque exato | API ou banco estruturado |
| Adaptar estilo e formato de saída | Prompting e, se necessário, fine-tuning |
| Executar ações em sistemas | Ferramentas com validação e confirmação |
| Dar ao usuário controle sobre a leitura | Busca tradicional com filtros |
Perguntas frequentes
RAG treina o modelo com os meus documentos?
Normalmente não. Os documentos são indexados e os trechos relevantes entram no contexto durante a consulta. O fornecedor ainda pode ter políticas próprias sobre retenção e treinamento com entradas; verifique contrato e configuração.
Banco vetorial é obrigatório?
Não. Busca lexical, banco relacional, mecanismo de pesquisa ou combinação híbrida podem ser suficientes. A escolha depende de conteúdo, consultas, escala, idioma e necessidade de filtros.
RAG elimina alucinações?
Não. Ele oferece evidência externa e pode reduzir erros factuais, mas recuperação e geração ainda podem falhar. Avaliação, citações verificáveis, recusa e revisão continuam necessárias.
Qual é o melhor tamanho de chunk?
Não existe tamanho universal. Use a estrutura do documento e teste se cada trecho preserva a unidade necessária para responder às perguntas reais. Compare recuperação, redundância, custo e qualidade final.
RAG e fine-tuning podem ser usados juntos?
Sim. Fine-tuning pode adaptar comportamento e formato, enquanto RAG fornece conhecimento atual ou privado. Mantenha avaliações separadas para saber qual componente trouxe o ganho.
Fontes e referências
Conteúdo educacional baseado nas fontes abaixo. Tecnologias, regras e serviços mudam; consulte sempre a versão mais recente antes de tomar decisões profissionais, jurídicas, financeiras ou de saúde.