Para avaliar um sistema RAG, separe a qualidade da recuperação da qualidade da resposta e monte uma coleção pequena de perguntas com respostas esperadas.
Monte um conjunto de avaliação pequeno
Escolha perguntas diretas, perguntas ambíguas, casos sem resposta e questões que exigem combinar dois trechos. O conjunto deve representar o uso, não apenas os exemplos que fazem o protótipo parecer bom.
Meça recuperação e geração separadamente
Se o trecho certo não foi recuperado, trocar o prompt não corrige a causa. Se o contexto está correto mas a resposta inventa, o problema está em instruções, modelo ou formato de saída.
Exija indicação de evidência
Faça a resposta apontar quais trechos sustentam a conclusão. Isso ajuda a revisão humana e torna mais fácil identificar quando o sistema respondeu além do que os documentos permitem.
Teste atualização e ausência
Inclua documentos novos, versões conflitantes e perguntas que não podem ser respondidas. Um sistema responsável precisa admitir que não encontrou evidência suficiente.
Próximo passo
Escolha uma parte pequena do sistema, registre o comportamento atual e faça uma mudança que possa ser observada e revertida. O objetivo não é aplicar uma receita inteira de uma vez, mas transformar uma hipótese em um teste que ensine algo sobre o projeto real.