Skip to content

Praxisbericht · unser eigener Lauf

Der Reranker sah wie ein Gewinn aus. Die Evidenz konnte es nicht sagen.

Wir haben Oloproof gegen einen live betriebenen, retrieval-gestützten Doku-Assistenten laufen lassen, den wir nicht betreiben: mit seinem eigenen Retriever und Index, echter Generierung, einem LLM-Judge und dem Referenz-Panel seiner Betreiber mit 58 Fragen, unverändert. Kein Kunde ist beteiligt. Das ist unser Lauf, so berichtet, wie wir ihn geprüft haben.

58
Fragen im Referenz-Panel der Betreiber
0 von 76
Feature-Flag-Vergleiche entschieden
1 von 9
Fälle, die zwischen identischen Läufen ihr Urteil ändern
15 von 23
fehlgeschlagene Antworten, mit der richtigen Passage behoben

Reranking an gegen Reranking aus, 22. September 2026

Der Reranker-Vergleich: die Rate jedes Arms mit ihrem 95-%-Intervall und der beobachteten Anzahl, und die gepaarte Differenz
MetrikReranking anReranking ausGepaarte Differenz, an minus aus
Richtige Seite auf Rang 10.745 [0.519, 0.875] · 51 von 580.618 [0.449, 0.760] · 55 von 58+6.2 Punkte [−36.3, +45.5] · 48 gepaart
Richtige Seite unter den Top 30.742 [0.270, 0.939] · 31 von 580.683 [0.350, 0.875] · 41 von 58+3.7 Punkte [−73.9, +76.2] · 27 gepaart
Antwort korrekt (LLM-Judge)0.760 [0.519, 0.888] · 50 von 580.685 [0.501, 0.819] · 54 von 58+6.5 Punkte [−39.4, +48.4] · 46 gepaart

Vorher

Der Assistent hatte bereits ein solides Test-Harness: ein Referenz-Panel, einen LLM-Judge und ein Release-Gate. Das Gate verglich eine Punktschätzung mit einem Zielwert, bei jeder Panelgröße. So gelesen brachte der Reranker 12,7 Punkte bei „richtige Seite auf Rang 1“ und wäre ausgeliefert worden. Und im Treue-Score, der über Releases entschied, zählte eine Antwort, die der Judge nicht bewerten konnte, als vollständiger Fehlschlag.

Nachher

Oloproof hat die beiden Arme über die Fragen gepaart, die beide beantwortet hatten, 4 Serverfehler und 2 nicht auswertbare Urteile als fehlend erfasst und jedes Intervall so verbreitert, dass es sie abdeckt. Alle drei Differenzen schneiden die Null, und zwar deutlich: Dieses Panel kann nicht sagen, ob der Reranker hilft oder schadet.

Die 23 fehlgeschlagenen Antworten erneut mit der richtigen Passage statt der abgerufenen auszuführen, behob 15 davon, neben einer Kontrolle, die sie unverändert erneut ausführte. Die Diagnose stufte 5 als Retrieval-Fehltreffer und 7 als Generierungsfehler ein, ließ 11 ungeklärt und nannte die Retrieval-Tiefe und die Index-Konfiguration als nächste Experimente.

Dreimal gemessen änderte etwa jeder neunte Fall sein Urteil, ohne dass sich etwas geändert hatte, und 13,8 % der Aufrufe lieferten einen Serverfehler. Diese Fehler als vorübergehend zu deklarieren, holte 18 von 22 fehlenden Fällen zurück und machte das Intervall um 39 % schmaler. Ein Durchlauf über die neunzehn Feature-Flags des Assistenten ergab dann 76 gepaarte Vergleiche, keiner davon entschieden, und etwa 40 weitere Fragen würden die drei vielversprechendsten entscheiden.

„Eine Suite aus 58 Fällen, von denen jeder neunte bei jeder Frage anders antwortet, hat keine Auflösung auf vier Nachkommastellen.“
Aus Oloproofs Bericht über den Lauf, 23. September 2026

Auf einen Blick

  • Ausgeführt vonOloproof, aus eigener Initiative
  • Bewertetes SystemEin live betriebener RAG-Doku-Assistent, den wir nicht betreiben
  • Panel58 Fragen, die eigenen der Betreiber, unverändert
  • JudgeEin LLM-Judge, noch nicht an menschlichen Labels geprüft
  • Ausgeführt am22. und 23. September 2026
  • Folgeläufe19 Feature-Flags; 24 Gespräche

Was er nicht zeigt

Ein System, ein Korpus und ein Panel, das zu klein ist, um seine eigene Frage zu entscheiden. Der Judge hinter jedem Antwort-Score wurde nicht an Menschen validiert, und die Diagnose sagt das. Das Panel ist Single-Turn: Ein Folgelauf mit 24 Gesprächen fand zwei reproduzierbare Fehler, die Single-Turn-Panels nicht hervorbringen können, darunter einen Assistenten, der bestritt, was er einen Turn zuvor gesagt hatte. Es ist kein Benchmark, und es ist kein Kunde.