Praxisbericht · unser eigener Lauf
Der Reranker sah wie ein Gewinn aus. Die Evidenz konnte es nicht sagen.
Wir haben Oloproof gegen einen live betriebenen, retrieval-gestützten Doku-Assistenten laufen lassen, den wir nicht betreiben: mit seinem eigenen Retriever und Index, echter Generierung, einem LLM-Judge und dem Referenz-Panel seiner Betreiber mit 58 Fragen, unverändert. Kein Kunde ist beteiligt. Das ist unser Lauf, so berichtet, wie wir ihn geprüft haben.
- 58
- Fragen im Referenz-Panel der Betreiber
- 0 von 76
- Feature-Flag-Vergleiche entschieden
- 1 von 9
- Fälle, die zwischen identischen Läufen ihr Urteil ändern
- 15 von 23
- fehlgeschlagene Antworten, mit der richtigen Passage behoben
Reranking an gegen Reranking aus, 22. September 2026
| Metrik | Reranking an | Reranking aus | Gepaarte Differenz, an minus aus |
|---|---|---|---|
| Richtige Seite auf Rang 1 | 0.745 [0.519, 0.875] · 51 von 58 | 0.618 [0.449, 0.760] · 55 von 58 | +6.2 Punkte [−36.3, +45.5] · 48 gepaart |
| Richtige Seite unter den Top 3 | 0.742 [0.270, 0.939] · 31 von 58 | 0.683 [0.350, 0.875] · 41 von 58 | +3.7 Punkte [−73.9, +76.2] · 27 gepaart |
| Antwort korrekt (LLM-Judge) | 0.760 [0.519, 0.888] · 50 von 58 | 0.685 [0.501, 0.819] · 54 von 58 | +6.5 Punkte [−39.4, +48.4] · 46 gepaart |
Vorher
Der Assistent hatte bereits ein solides Test-Harness: ein Referenz-Panel, einen LLM-Judge und ein Release-Gate. Das Gate verglich eine Punktschätzung mit einem Zielwert, bei jeder Panelgröße. So gelesen brachte der Reranker 12,7 Punkte bei „richtige Seite auf Rang 1“ und wäre ausgeliefert worden. Und im Treue-Score, der über Releases entschied, zählte eine Antwort, die der Judge nicht bewerten konnte, als vollständiger Fehlschlag.
Nachher
Oloproof hat die beiden Arme über die Fragen gepaart, die beide beantwortet hatten, 4 Serverfehler und 2 nicht auswertbare Urteile als fehlend erfasst und jedes Intervall so verbreitert, dass es sie abdeckt. Alle drei Differenzen schneiden die Null, und zwar deutlich: Dieses Panel kann nicht sagen, ob der Reranker hilft oder schadet.
Die 23 fehlgeschlagenen Antworten erneut mit der richtigen Passage statt der abgerufenen auszuführen, behob 15 davon, neben einer Kontrolle, die sie unverändert erneut ausführte. Die Diagnose stufte 5 als Retrieval-Fehltreffer und 7 als Generierungsfehler ein, ließ 11 ungeklärt und nannte die Retrieval-Tiefe und die Index-Konfiguration als nächste Experimente.
Dreimal gemessen änderte etwa jeder neunte Fall sein Urteil, ohne dass sich etwas geändert hatte, und 13,8 % der Aufrufe lieferten einen Serverfehler. Diese Fehler als vorübergehend zu deklarieren, holte 18 von 22 fehlenden Fällen zurück und machte das Intervall um 39 % schmaler. Ein Durchlauf über die neunzehn Feature-Flags des Assistenten ergab dann 76 gepaarte Vergleiche, keiner davon entschieden, und etwa 40 weitere Fragen würden die drei vielversprechendsten entscheiden.
„Eine Suite aus 58 Fällen, von denen jeder neunte bei jeder Frage anders antwortet, hat keine Auflösung auf vier Nachkommastellen.“
Auf einen Blick
- Ausgeführt vonOloproof, aus eigener Initiative
- Bewertetes SystemEin live betriebener RAG-Doku-Assistent, den wir nicht betreiben
- Panel58 Fragen, die eigenen der Betreiber, unverändert
- JudgeEin LLM-Judge, noch nicht an menschlichen Labels geprüft
- Ausgeführt am22. und 23. September 2026
- Folgeläufe19 Feature-Flags; 24 Gespräche
Was er nicht zeigt
Ein System, ein Korpus und ein Panel, das zu klein ist, um seine eigene Frage zu entscheiden. Der Judge hinter jedem Antwort-Score wurde nicht an Menschen validiert, und die Diagnose sagt das. Das Panel ist Single-Turn: Ein Folgelauf mit 24 Gesprächen fand zwei reproduzierbare Fehler, die Single-Turn-Panels nicht hervorbringen können, darunter einen Assistenten, der bestritt, was er einen Turn zuvor gesagt hatte. Es ist kein Benchmark, und es ist kein Kunde.