Praktijkrapport · onze eigen run
De reranker leek winst. Het bewijs kon het niet zeggen.
We draaiden Oloproof tegen een live documentatieassistent met retrieval-augmented generation die wij niet beheren: zijn eigen retriever en index, echte generatie, een LLM-judge en het referentiepanel van 58 vragen van de eigenaren, ongewijzigd. Er is geen klant bij betrokken. Dit is onze run, gerapporteerd zoals we hem hebben gecontroleerd.
- 58
- vragen in het referentiepanel van de eigenaren
- 0 van 76
- feature-flagvergelijkingen beslist
- 1 op 9
- cases die tussen identieke runs van oordeel veranderen
- 15 van 23
- mislukte antwoorden hersteld met de juiste passage
Rerank aan tegen rerank uit, 22 september 2026
| Metriek | Rerank aan | Rerank uit | Gepaard verschil, aan min uit |
|---|---|---|---|
| Juiste pagina op rang 1 | 0.745 [0.519, 0.875] · 51 van 58 | 0.618 [0.449, 0.760] · 55 van 58 | +6.2 punten [−36.3, +45.5] · 48 gepaard |
| Juiste pagina in de top 3 | 0.742 [0.270, 0.939] · 31 van 58 | 0.683 [0.350, 0.875] · 41 van 58 | +3.7 punten [−73.9, +76.2] · 27 gepaard |
| Antwoord juist (LLM-judge) | 0.760 [0.519, 0.888] · 50 van 58 | 0.685 [0.501, 0.819] · 54 van 58 | +6.5 punten [−39.4, +48.4] · 46 gepaard |
Voor
De assistent had al een degelijk testharnas: een referentiepanel, een LLM-judge en een releasegate. De gate vergeleek een puntschatting met een doel, bij elke panelgrootte. Zo gelezen voegde de reranker 12,7 punten juiste-pagina-op-positie-1 toe en was hij uitgebracht. En in de getrouwheidsscore die over releases besliste, telde een antwoord dat de judge niet kon beoordelen als een volledige mislukking.
Na
Oloproof paarde de twee armen op de vragen die beide hadden beantwoord, registreerde 4 serverfouten en 2 onleesbare oordelen als ontbrekend, en verbreedde elk interval om ze te omvatten. Alle drie de verschillen kruisen nul, ruim: dit panel kan niet zeggen of de reranker helpt of schaadt.
Door de 23 mislukte antwoorden opnieuw te draaien met de juiste passage in plaats van de opgehaalde, werden er 15 hersteld, naast een controle die ze ongewijzigd opnieuw draaide. De diagnose labelde 5 retrievalmissers en 7 generatiefouten, liet er 11 onopgelost en noemde de retrievaldiepte en de indexconfiguratie als de volgende experimenten.
Drie keer gemeten veranderde ongeveer één case op negen van oordeel terwijl er niets veranderd was, en 13,8% van de aanroepen gaf een serverfout. Door die fouten als tijdelijk te declareren werden 18 van de 22 ontbrekende cases hersteld en werd het interval 39% smaller. Een sweep over de negentien feature flags van de assistent leverde daarna 76 gepaarde vergelijkingen op, geen enkele beslist, en ongeveer 40 vragen meer zouden de drie meest veelbelovende beslissen.
‘Een suite van 58 cases, waarvan er één op negen elke keer dat je het vraagt anders antwoordt, heeft geen resolutie van vier decimalen.’
In één oogopslag
- Uitgevoerd doorOloproof, op eigen initiatief
- Geëvalueerd systeemEen live RAG-documentatieassistent die wij niet beheren
- Panel58 vragen, die van de eigenaren zelf, ongewijzigd
- JudgeEen LLM-judge, nog niet getoetst aan menselijke labels
- Uitgevoerd op22 en 23 september 2026
- Vervolgruns19 feature flags; 24 gesprekken
Wat het niet laat zien
Eén systeem, één corpus en een panel dat te klein is om zijn eigen vraag te beslissen. De judge achter elke antwoordscore is niet gevalideerd tegen mensen, en de diagnose zegt dat ook. Het panel is single-turn: een vervolgrun van 24 gesprekken vond twee reproduceerbare fouten die single-turnpanels niet kunnen voortbrengen, waaronder een assistent die ontkende wat hij een beurt eerder had gezegd. Het is geen benchmark, en het is geen klant.