Para times de RAG e recuperação
Saiba o que a sua mudança de índice fez.
Mudanças de recuperação movem a qualidade de formas que um diff do chunking não mostra. O Oloproof executa o seu sistema RAG como duas etapas que ele consegue ver e mede recuperação, citações, fundamentação e correção das respostas nos mesmos casos, antes e depois.
Medir
Avaliadores que entendem a recuperação
Taxa de acerto, recall, MRR e nDCG no corte que você escolher, lidos dos candidatos registrados; validade das citações em relação ao contexto que o modelo recebeu; juízes de fundamentação e de suporte das citações que o leem. Um corte mais profundo do que o recuperador retornou é recusado, não pontuado como erro.
Isolar
Uma etapa de cada vez
Cada etapa fica em cache separadamente, então uma mudança de prompt nunca busca de novo. O diagnóstico executa de novo os casos com falha usando o trecho correto ao lado de um controle e rotula cada um como falha de recuperação, fora do ranking, perdido do contexto ou falha de geração.
Decidir
O gate decide pelo intervalo
Candidato e baseline são pareados caso a caso contra as margens que você declara. Uma regra passa só quando o intervalo dela ultrapassa a margem; um intervalo largo demais para dizer bloqueia o lançamento por evidência insuficiente, com a evidência guardada ao lado da decisão.
Um resultado real
Página certa na posição 1
+6.2 pontos
[−36.3, +45.5] · 48 pareadas · indefinido
Página certa entre as 3 primeiras
+3.7 pontos
[−73.9, +76.2] · 27 pareadas · indefinido
Resposta correta
+6.5 pontos
[−39.4, +48.4] · 46 pareadas · indefinido
Lendo as estimativas pontuais, o reranker acrescentava 12,7 pontos de página certa na posição 1 e teria sido lançado. Pareados nas perguntas que os dois braços responderam, todos os intervalos cruzam o zero: este painel não consegue dizer se o reranker ajuda ou atrapalha, e o Oloproof diz isso em vez de escolher um vencedor. Leia o relatório de campo.