Voor RAG- en retrievalteams
Weet wat je indexwijziging deed.
Retrievalwijzigingen verschuiven de kwaliteit op manieren die een chunking-diff niet kan laten zien. Oloproof draait je RAG-systeem als twee fasen die het kan zien, en meet retrieval, citaties, gefundeerdheid en juistheid van antwoorden op dezelfde cases, voor en na.
Meten
Retrievalbewuste evaluators
Hit rate, recall, MRR en nDCG bij de cutoff die je kiest, gelezen uit de vastgelegde kandidaten; geldigheid van citaties ten opzichte van de context die het model kreeg; judges voor gefundeerdheid en citatieonderbouwing die die context lezen. Een cutoff dieper dan wat de retriever teruggaf, wordt geweigerd, niet als misser gescoord.
Isoleren
Eén fase tegelijk
Elke fase wordt apart gecachet, dus een promptwijziging zoekt nooit opnieuw. De diagnose draait mislukte cases opnieuw met de juiste passage naast een controle en labelt elk als retrievalmisser, uit de ranking gevallen, uit de context verloren of generatiefout.
Beslissen
Gate op het interval
Kandidaat en baseline worden case voor case gepaard tegen de marges die je declareert. Een regel slaagt alleen als zijn interval de marge haalt; een interval dat te breed is om iets te zeggen, blokkeert de release als onvoldoende bewijs, met het bewijs bewaard naast de beslissing.
Een echt resultaat
Juiste pagina op rang 1
+6.2 punten
[−36.3, +45.5] · 48 gepaard · onbeslist
Juiste pagina in de top 3
+3.7 punten
[−73.9, +76.2] · 27 gepaard · onbeslist
Antwoord juist
+6.5 punten
[−39.4, +48.4] · 46 gepaard · onbeslist
Afgelezen van de puntschattingen voegde de reranker 12,7 punten juiste-pagina-op-positie-1 toe en was hij uitgebracht. Gepaard op de vragen die beide armen beantwoordden, kruist elk interval nul: dit panel kan niet zeggen of de reranker helpt of schaadt, en Oloproof zegt dat in plaats van een winnaar te kiezen. Lees het praktijkrapport.