Für RAG- und Retrieval-Teams
Wissen, was Ihre Index-Änderung bewirkt hat.
Retrieval-Änderungen bewegen die Qualität auf eine Weise, die ein Chunking-Diff nicht zeigen kann. Oloproof führt Ihr RAG-System als zwei Stufen aus, die es sehen kann, und misst Retrieval, Zitate, Fundiertheit und Antwortkorrektheit an denselben Fällen, vorher und nachher.
Messen
Retrieval-bewusste Evaluatoren
Trefferquote, Recall, MRR und nDCG beim Cutoff Ihrer Wahl, gelesen aus den aufgezeichneten Kandidaten; Zitatgültigkeit gegenüber dem Kontext, den das Modell erhalten hat; Judges für Fundiertheit und Zitatbelege, die ihn lesen. Ein Cutoff, der tiefer liegt, als der Retriever geliefert hat, wird abgelehnt, nicht als Fehltreffer gewertet.
Isolieren
Eine Stufe nach der anderen
Jede Stufe wird einzeln gecacht, sodass eine Prompt-Änderung nie erneut sucht. Die Diagnose führt fehlgeschlagene Fälle mit der richtigen Passage neben einer Kontrolle erneut aus und stuft jeden als Retrieval-Fehltreffer, aus dem Ranking gefallen, aus dem Kontext verloren oder Generierungsfehler ein.
Entscheiden
Gate am Intervall
Kandidat und Baseline werden Fall für Fall gegen die von Ihnen deklarierten Margen gepaart. Eine Regel besteht nur, wenn ihr Intervall die Marge überschreitet; ein Intervall, das zu breit ist, um es zu sagen, blockiert das Release als unzureichende Evidenz, und die Evidenz wird neben der Entscheidung aufbewahrt.
Ein echtes Ergebnis
Richtige Seite auf Rang 1
+6.2 Punkte
[−36.3, +45.5] · 48 gepaart · unentschieden
Richtige Seite unter den Top 3
+3.7 Punkte
[−73.9, +76.2] · 27 gepaart · unentschieden
Antwort korrekt
+6.5 Punkte
[−39.4, +48.4] · 46 gepaart · unentschieden
Nach den Punktschätzungen brachte der Reranker 12,7 Punkte bei „richtige Seite auf Rang 1“ und wäre ausgeliefert worden. Gepaart über die Fragen, die beide Arme beantwortet haben, schneidet jedes Intervall die Null: Dieses Panel kann nicht sagen, ob der Reranker hilft oder schadet, und Oloproof sagt das, statt einen Gewinner zu küren. Den Praxisbericht lesen.