Per i team di RAG e recupero
Scopri che cosa ha fatto la tua modifica all’indice.
Le modifiche al recupero spostano la qualità in modi che un diff del chunking non può mostrare. Oloproof esegue il tuo sistema RAG come due fasi che può vedere e misura recupero, citazioni, fondatezza e correttezza delle risposte sugli stessi casi, prima e dopo.
Misurare
Valutatori consapevoli del recupero
Hit rate, recall, MRR e nDCG al cutoff che scegli, letti dai candidati registrati; validità delle citazioni rispetto al contesto fornito al modello; giudici di fondatezza e di supporto alle citazioni che lo leggono. Un cutoff più profondo di quanto restituito dal retriever viene rifiutato, non conteggiato come mancato.
Isolare
Una fase alla volta
Ogni fase è in cache per conto suo, quindi una modifica al prompt non ripete mai la ricerca. La diagnosi riesegue i casi falliti con il passaggio corretto accanto a un controllo ed etichetta ciascuno come mancato recupero, escluso dal ranking, perso dal contesto o fallimento di generazione.
Decidere
Il gate si decide sull’intervallo
Candidato e baseline sono appaiati caso per caso rispetto ai margini che dichiari. Una regola passa solo quando il suo intervallo supera il margine; un intervallo troppo ampio per dirlo blocca il rilascio per prove insufficienti, con le prove conservate accanto alla decisione.
Un risultato reale
Pagina giusta in posizione 1
+6.2 punti
[−36.3, +45.5] · 48 appaiate · non deciso
Pagina giusta tra le prime 3
+3.7 punti
[−73.9, +76.2] · 27 appaiate · non deciso
Risposta corretta
+6.5 punti
[−39.4, +48.4] · 46 appaiate · non deciso
Guardando le stime puntuali, il reranker aggiungeva 12,7 punti di pagina giusta in posizione 1 e sarebbe stato rilasciato. Appaiati sulle domande a cui entrambi i bracci hanno risposto, tutti gli intervalli attraversano lo zero: questo panel non può dire se il reranker aiuta o peggiora, e Oloproof lo dice invece di scegliere un vincitore. Leggi il rapporto sul campo.