Skip to content

Praktijkrapport · onze eigen run

De reranker leek winst. Het bewijs kon het niet zeggen.

We draaiden Oloproof tegen een live documentatieassistent met retrieval-augmented generation die wij niet beheren: zijn eigen retriever en index, echte generatie, een LLM-judge en het referentiepanel van 58 vragen van de eigenaren, ongewijzigd. Er is geen klant bij betrokken. Dit is onze run, gerapporteerd zoals we hem hebben gecontroleerd.

58
vragen in het referentiepanel van de eigenaren
0 van 76
feature-flagvergelijkingen beslist
1 op 9
cases die tussen identieke runs van oordeel veranderen
15 van 23
mislukte antwoorden hersteld met de juiste passage

Rerank aan tegen rerank uit, 22 september 2026

De rerankervergelijking: het percentage van elke arm met zijn 95%-interval en het waargenomen aantal, en het gepaarde verschil
MetriekRerank aanRerank uitGepaard verschil, aan min uit
Juiste pagina op rang 10.745 [0.519, 0.875] · 51 van 580.618 [0.449, 0.760] · 55 van 58+6.2 punten [−36.3, +45.5] · 48 gepaard
Juiste pagina in de top 30.742 [0.270, 0.939] · 31 van 580.683 [0.350, 0.875] · 41 van 58+3.7 punten [−73.9, +76.2] · 27 gepaard
Antwoord juist (LLM-judge)0.760 [0.519, 0.888] · 50 van 580.685 [0.501, 0.819] · 54 van 58+6.5 punten [−39.4, +48.4] · 46 gepaard

Voor

De assistent had al een degelijk testharnas: een referentiepanel, een LLM-judge en een releasegate. De gate vergeleek een puntschatting met een doel, bij elke panelgrootte. Zo gelezen voegde de reranker 12,7 punten juiste-pagina-op-positie-1 toe en was hij uitgebracht. En in de getrouwheidsscore die over releases besliste, telde een antwoord dat de judge niet kon beoordelen als een volledige mislukking.

Na

Oloproof paarde de twee armen op de vragen die beide hadden beantwoord, registreerde 4 serverfouten en 2 onleesbare oordelen als ontbrekend, en verbreedde elk interval om ze te omvatten. Alle drie de verschillen kruisen nul, ruim: dit panel kan niet zeggen of de reranker helpt of schaadt.

Door de 23 mislukte antwoorden opnieuw te draaien met de juiste passage in plaats van de opgehaalde, werden er 15 hersteld, naast een controle die ze ongewijzigd opnieuw draaide. De diagnose labelde 5 retrievalmissers en 7 generatiefouten, liet er 11 onopgelost en noemde de retrievaldiepte en de indexconfiguratie als de volgende experimenten.

Drie keer gemeten veranderde ongeveer één case op negen van oordeel terwijl er niets veranderd was, en 13,8% van de aanroepen gaf een serverfout. Door die fouten als tijdelijk te declareren werden 18 van de 22 ontbrekende cases hersteld en werd het interval 39% smaller. Een sweep over de negentien feature flags van de assistent leverde daarna 76 gepaarde vergelijkingen op, geen enkele beslist, en ongeveer 40 vragen meer zouden de drie meest veelbelovende beslissen.

‘Een suite van 58 cases, waarvan er één op negen elke keer dat je het vraagt anders antwoordt, heeft geen resolutie van vier decimalen.’
Uit het rapport van Oloproof over de run, 23 september 2026

In één oogopslag

  • Uitgevoerd doorOloproof, op eigen initiatief
  • Geëvalueerd systeemEen live RAG-documentatieassistent die wij niet beheren
  • Panel58 vragen, die van de eigenaren zelf, ongewijzigd
  • JudgeEen LLM-judge, nog niet getoetst aan menselijke labels
  • Uitgevoerd op22 en 23 september 2026
  • Vervolgruns19 feature flags; 24 gesprekken

Wat het niet laat zien

Eén systeem, één corpus en een panel dat te klein is om zijn eigen vraag te beslissen. De judge achter elke antwoordscore is niet gevalideerd tegen mensen, en de diagnose zegt dat ook. Het panel is single-turn: een vervolgrun van 24 gesprekken vond twee reproduceerbare fouten die single-turnpanels niet kunnen voortbrengen, waaronder een assistent die ontkende wat hij een beurt eerder had gezegd. Het is geen benchmark, en het is geen klant.