Raport z praktyki · nasz własny przebieg
Reranker wyglądał na zysk. Dowody nie pozwalały tego stwierdzić.
Uruchomiliśmy Oloproof na działającym asystencie dokumentacji z generowaniem wspomaganym wyszukiwaniem, którego nie prowadzimy: z jego własnym retrieverem i indeksem, prawdziwym generowaniem, sędzią LLM i referencyjnym panelem 58 pytań jego właścicieli, bez zmian. Żaden klient nie jest w to zaangażowany. To nasz przebieg, opisany tak, jak go audytowaliśmy.
- 58
- pytań w referencyjnym panelu właścicieli
- 0 z 76
- porównań flag funkcji rozstrzygniętych
- 1 na 9
- przypadków zmieniających werdykt między identycznymi przebiegami
- 15 z 23
- błędnych odpowiedzi naprawionych właściwym fragmentem
Reranking włączony kontra wyłączony, 22 września 2026
| Metryka | Reranking włączony | Reranking wyłączony | Różnica w parach, włączony minus wyłączony |
|---|---|---|---|
| Właściwa strona na pozycji 1 | 0.745 [0.519, 0.875] · 51 z 58 | 0.618 [0.449, 0.760] · 55 z 58 | +6.2 pkt proc. [−36.3, +45.5] · 48 w parach |
| Właściwa strona w pierwszej 3 | 0.742 [0.270, 0.939] · 31 z 58 | 0.683 [0.350, 0.875] · 41 z 58 | +3.7 pkt proc. [−73.9, +76.2] · 27 w parach |
| Poprawna odpowiedź (sędzia LLM) | 0.760 [0.519, 0.888] · 50 z 58 | 0.685 [0.501, 0.819] · 54 z 58 | +6.5 pkt proc. [−39.4, +48.4] · 46 w parach |
Przed
Asystent miał już solidną uprząż testową: panel referencyjny, sędziego LLM i bramkę wydania. Bramka porównywała estymację punktową z celem, przy każdym rozmiarze panelu. Czytany w ten sposób reranker dodawał 12,7 pkt proc. do „właściwej strony na pozycji 1” i trafiłby do wydania. A w wyniku wierności, który decydował o wydaniach, odpowiedź, której sędzia nie zdołał ocenić, liczyła się jako całkowita porażka.
Po
Oloproof sparował oba ramiona na pytaniach, na które oba odpowiedziały, zapisał 4 błędy serwera i 2 nieczytelne werdykty jako brakujące i poszerzył każdy przedział, by je objąć. Wszystkie trzy różnice przecinają zero, i to wyraźnie: ten panel nie może stwierdzić, czy reranker pomaga, czy szkodzi.
Ponowne uruchomienie 23 błędnych odpowiedzi z właściwym fragmentem zamiast pobranego naprawiło 15 z nich, obok próby kontrolnej uruchomionej ponownie bez zmian. Diagnoza oznaczyła 5 jako chybione wyszukiwanie i 7 jako błędy generowania, 11 pozostawiła nierozstrzygniętych i wskazała głębokość wyszukiwania oraz konfigurację indeksu jako kolejne eksperymenty.
Przy trzykrotnym pomiarze mniej więcej co dziewiąty przypadek zmieniał werdykt, choć nic się nie zmieniło, a 13,8% wywołań zwróciło błąd serwera. Uznanie tych błędów za przejściowe odzyskało 18 z 22 brakujących przypadków i zawęziło przedział o 39%. Przegląd dziewiętnastu flag funkcji asystenta dał następnie 76 porównań w parach, z których żadne nie zostało rozstrzygnięte, a około 40 dodatkowych pytań rozstrzygnęłoby trzy najbardziej obiecujące.
„Zestaw 58 przypadków, z których co dziewiąty odpowiada inaczej przy każdym pytaniu, nie ma rozdzielczości czterech miejsc po przecinku”.
W skrócie
- UruchomiłOloproof, z własnej inicjatywy
- Oceniany systemDziałający asystent dokumentacji RAG, którego nie prowadzimy
- Panel58 pytań, własnych pytań właścicieli, bez zmian
- SędziaSędzia LLM, jeszcze niesprawdzony względem etykiet ludzkich
- Data przebiegu22 i 23 września 2026
- Przebiegi uzupełniające19 flag funkcji; 24 rozmowy
Czego to nie pokazuje
Jeden system, jeden korpus i panel za mały, by rozstrzygnąć własne pytanie. Sędzia stojący za każdym wynikiem odpowiedzi nie został zwalidowany względem ludzi, i diagnoza to mówi. Panel jest jednoturowy: przebieg uzupełniający z 24 rozmowami znalazł dwie powtarzalne porażki, których panele jednoturowe nie mogą wywołać, w tym asystenta zaprzeczającego temu, co powiedział turę wcześniej. To nie jest benchmark i to nie jest klient.