Skip to content
← Alle Artikel

Ihre Eval-Scores lügen über die Stichprobengröße

Ein einzelner Durchschnitt ist die häufigste Art, wie Teams sich über eine KI-Änderung selbst täuschen. Hier ist, was wir stattdessen berichten, und warum das Intervall vor die Zahl gehört.

Nehmen Sie ein Golden Panel von 58 Fällen und einen live laufenden Dokumentationsassistenten, der aus einem echten Suchindex antwortet, und vergleichen Sie ihn mit eingeschaltetem und ausgeschaltetem Reranker. Nach den Punktschätzungen erhöht der Reranker den Anteil der Antworten, deren bestplatzierte Seite die richtige ist, von 61,8% auf 74,5%. Das liest sich wie Fortschritt, und in einem Statusbericht wird es meist als Gewinn von 12,7 Punkten gemeldet.

Führen Sie denselben Arm zweimal aus, ohne etwas zu ändern, und die Antwortkorrektheit kam mit 71,2% zurück, dann mit 76,0%. Erneut gemessen mit drei Replikaten pro Fall, änderte etwa jeder neunte beobachtete Fall sein Urteil zwischen identischen Messungen: 6 von 54 bei der Korrektheit, 7 von 57 bei der bestplatzierten Seite.

Der Grund ist nicht, dass die Messung kaputt ist. Sondern dass ein Unterschied auf 58 Fällen, von denen sich einige gar nicht messen ließen, weit innerhalb des Rauschens liegt, das die Stichprobe von allein erzeugen kann. Das Intervall, nicht die Punktschätzung, sagt Ihnen, ob Sie etwas gelernt haben.

Was zu berichten ist

Drei Zahlen, in dieser Reihenfolge: die Differenz, ihr Intervall und die Zahl der Fälle dahinter. Mit weniger kann ein Leser die Aussage nicht beurteilen. Hier ist dieser Lauf, Reranker an gegen Reranker aus, Fall für Fall gepaart, in Punkten:

Gepaarte Differenzen, Reranker an minus Reranker aus, auf einem Panel von 58 Fällen
Gepaarte FälleMetrikDifferenz95%-IntervallBedeutet
48Richtige Seite auf Rang 1+6.2−36.3 … +45.5Nicht schlüssig
46Antwort korrekt+6.5−39.4 … +48.4Nicht schlüssig
27Richtige Seite unter den Top 3+3.7−73.9 … +76.2Nicht schlüssig

Jedes Intervall schneidet die Null, und zwar weit. Die Punktschätzungen sagen alle, dass der Reranker hilft; die Intervalle sagen, dass dieses Panel nicht sagen kann, ob er hilft oder schadet. Das ist ein eigenständiger Befund: Das Panel ist zu klein und verliert zu viele Fälle, um die Frage zu klären, für die es verwendet wurde.

Fehlend ist nicht null

Vier der 58 Aufrufe lieferten HTTP 500 vom getesteten System, und zwei Judge-Aufrufe lieferten kein Urteil, das sich parsen ließ. Ein Harness, der einen unbewerteten Fall als null mittelt, erfasst diese sechs als Versagen des Assistenten: sechs fabrizierte Fehlschläge von 58. Oloproof erfasst sie als fehlend und erweitert das Intervall, um einzugrenzen, was immer sie gewesen sein könnten.

Genau das preist die dritte Zeile ein. Nur 27 der 58 Fälle ließen sich bei einem Cutoff von drei gerankten Seiten messen, und das Intervall berücksichtigt die anderen 31, statt sie zu verstecken.

Kleine Panels bestehen Gates

Dieselbe Regel gilt am kleinen Ende. Ein Smoke-Lauf mit drei Fällen erzielte 1,000, mit einem 95%-Intervall von 0,292 bis 1,000. Ein Gate, das die Punktschätzung mit einem Ziel vergleicht, gibt ihn frei. Ein Gate, das das Intervall liest, sagt, was wahr ist: Drei Fälle können ein perfektes System nicht von einem unterscheiden, das in drei von zehn Fällen richtig liegt.

Das Intervall verengen

Mehr Fälle verengen ein Intervall, und weniger verlorene Fälle ebenso. Auf demselben Panel wurden die HTTP-500-Antworten des Systems als transient deklariert, sodass der Runner sie wiederholte; das holte 18 von 22 fehlenden Fällen zurück und verengte das Intervall um 39%, Minuten später und ohne sonstige Änderung.

Eine Differenz, deren Intervall den Schwellenwert klar überschreitet, stützt eine Entscheidung, egal wie groß sie ist, und auf diese sollte ein Gate reagieren. Bis dahin berichten Sie die Differenz, ihr Intervall und die Fälle dahinter, und sagen Sie, dass die Antwort noch aussteht.

Möchten Sie das bei jeder Änderung für Sie berechnet haben?

Kontakt aufnehmen