Skip to content
← Alle artikelen

Je eval-scores liegen over de steekproefgrootte

Eén gemiddelde is de meest gebruikelijke manier waarop teams zichzelf voor de gek houden over een AI-wijziging. Dit rapporteren we in plaats daarvan, en daarom hoort het interval vóór het getal.

Neem een golden panel van 58 cases en een live documentatieassistent die antwoordt uit een echte zoekindex, en vergelijk hem met zijn reranker aan en uit. Op basis van de puntschattingen verhoogt de reranker het aandeel antwoorden waarvan de hoogst gerangschikte pagina de juiste is van 61,8% naar 74,5%. Dat leest als vooruitgang, en in een statusupdate wordt het meestal gerapporteerd als een winst van 12,7 punten.

Draai dezelfde arm twee keer zonder iets te veranderen, en de juistheid van antwoorden kwam terug op 71,2%, daarna op 76,0%. Opnieuw gemeten met drie replicaties per case veranderde ongeveer één op de negen waargenomen cases van oordeel tussen identieke metingen: 6 van 54 voor juistheid, 7 van 57 voor de hoogst gerangschikte pagina.

De reden is niet dat de meting kapot is. De reden is dat een verschil op 58 cases, waarvan sommige helemaal niet gemeten konden worden, ruim binnen de ruis valt die de steekproef zelf kan voortbrengen. Het interval, niet de puntschatting, vertelt je of je iets hebt geleerd.

Wat je rapporteert

Drie getallen, in deze volgorde: het verschil, het interval ervan en het aantal cases erachter. Met minder kan een lezer de bewering niet beoordelen. Hier is die run, reranker aan tegenover reranker uit, per case gepaard, in punten:

Gepaarde verschillen, reranker aan min reranker uit, op een panel van 58 cases
Gepaarde casesMetriekVerschil95%-intervalBetekent
48Juiste pagina op rang 1+6.2−36.3 … +45.5Niet doorslaggevend
46Antwoord juist+6.5−39.4 … +48.4Niet doorslaggevend
27Juiste pagina in de top 3+3.7−73.9 … +76.2Niet doorslaggevend

Elk interval kruist nul, en ruim. De puntschattingen zeggen allemaal dat de reranker helpt; de intervallen zeggen dat dit panel niet kan bepalen of hij helpt of schaadt. Dat is op zich al een bevinding: het panel is te klein, en verliest te veel cases, om de vraag te beslechten waarvoor het werd gebruikt.

Ontbrekend is geen nul

Vier van de 58 aanroepen gaven HTTP 500 terug van het geteste systeem, en twee judge-aanroepen gaven geen oordeel terug dat te parsen was. Een harness die een onbeoordeelde case als nul meetelt in het gemiddelde, registreert die zes als falen van de assistent: zes verzonnen mislukkingen op 58. Oloproof registreert ze als ontbrekend en verbreedt het interval zodat het begrenst wat ze ook maar geweest hadden kunnen zijn.

Dat is wat de derde rij inprijst. Slechts 27 van de 58 cases konden worden gemeten bij een grens van drie gerangschikte pagina's, en het interval houdt rekening met de andere 31 in plaats van ze te verbergen.

Kleine panels halen gates

Dezelfde regel geldt aan de kleine kant. Een smoke-run van drie cases scoorde 1,000, met een 95%-interval van 0,292 tot 1,000. Een gate die de puntschatting met een doel vergelijkt, laat hem door. Een gate die het interval leest, zegt wat waar is: drie cases kunnen een perfect systeem niet onderscheiden van een systeem dat drie keer op de tien gelijk heeft.

Het interval smaller maken

Meer cases maken een interval smaller, en minder cases verliezen ook. Op hetzelfde panel werden de HTTP 500-fouten van het systeem als tijdelijk gedeclareerd, zodat de runner ze opnieuw probeerde; dat herstelde 18 van de 22 ontbrekende cases en maakte het interval 39% smaller, minuten later, zonder verder iets te veranderen.

Een verschil waarvan het interval de drempel haalt, ondersteunt een beslissing, hoe groot het ook is, en daar hoort een gate op te reageren. Tot dan rapporteer je het verschil, het interval ervan en de cases erachter, en zeg je dat het antwoord er nog niet is.

Wil je dit bij elke wijziging voor je laten berekenen?

Neem contact op