Skip to content

Raport z praktyki · nasz własny przebieg

Reranker wyglądał na zysk. Dowody nie pozwalały tego stwierdzić.

Uruchomiliśmy Oloproof na działającym asystencie dokumentacji z generowaniem wspomaganym wyszukiwaniem, którego nie prowadzimy: z jego własnym retrieverem i indeksem, prawdziwym generowaniem, sędzią LLM i referencyjnym panelem 58 pytań jego właścicieli, bez zmian. Żaden klient nie jest w to zaangażowany. To nasz przebieg, opisany tak, jak go audytowaliśmy.

58
pytań w referencyjnym panelu właścicieli
0 z 76
porównań flag funkcji rozstrzygniętych
1 na 9
przypadków zmieniających werdykt między identycznymi przebiegami
15 z 23
błędnych odpowiedzi naprawionych właściwym fragmentem

Reranking włączony kontra wyłączony, 22 września 2026

Porównanie rerankera: odsetek w każdym ramieniu z przedziałem 95% i zaobserwowaną liczbą oraz różnica w parach
MetrykaReranking włączonyReranking wyłączonyRóżnica w parach, włączony minus wyłączony
Właściwa strona na pozycji 10.745 [0.519, 0.875] · 51 z 580.618 [0.449, 0.760] · 55 z 58+6.2 pkt proc. [−36.3, +45.5] · 48 w parach
Właściwa strona w pierwszej 30.742 [0.270, 0.939] · 31 z 580.683 [0.350, 0.875] · 41 z 58+3.7 pkt proc. [−73.9, +76.2] · 27 w parach
Poprawna odpowiedź (sędzia LLM)0.760 [0.519, 0.888] · 50 z 580.685 [0.501, 0.819] · 54 z 58+6.5 pkt proc. [−39.4, +48.4] · 46 w parach

Przed

Asystent miał już solidną uprząż testową: panel referencyjny, sędziego LLM i bramkę wydania. Bramka porównywała estymację punktową z celem, przy każdym rozmiarze panelu. Czytany w ten sposób reranker dodawał 12,7 pkt proc. do „właściwej strony na pozycji 1” i trafiłby do wydania. A w wyniku wierności, który decydował o wydaniach, odpowiedź, której sędzia nie zdołał ocenić, liczyła się jako całkowita porażka.

Po

Oloproof sparował oba ramiona na pytaniach, na które oba odpowiedziały, zapisał 4 błędy serwera i 2 nieczytelne werdykty jako brakujące i poszerzył każdy przedział, by je objąć. Wszystkie trzy różnice przecinają zero, i to wyraźnie: ten panel nie może stwierdzić, czy reranker pomaga, czy szkodzi.

Ponowne uruchomienie 23 błędnych odpowiedzi z właściwym fragmentem zamiast pobranego naprawiło 15 z nich, obok próby kontrolnej uruchomionej ponownie bez zmian. Diagnoza oznaczyła 5 jako chybione wyszukiwanie i 7 jako błędy generowania, 11 pozostawiła nierozstrzygniętych i wskazała głębokość wyszukiwania oraz konfigurację indeksu jako kolejne eksperymenty.

Przy trzykrotnym pomiarze mniej więcej co dziewiąty przypadek zmieniał werdykt, choć nic się nie zmieniło, a 13,8% wywołań zwróciło błąd serwera. Uznanie tych błędów za przejściowe odzyskało 18 z 22 brakujących przypadków i zawęziło przedział o 39%. Przegląd dziewiętnastu flag funkcji asystenta dał następnie 76 porównań w parach, z których żadne nie zostało rozstrzygnięte, a około 40 dodatkowych pytań rozstrzygnęłoby trzy najbardziej obiecujące.

„Zestaw 58 przypadków, z których co dziewiąty odpowiada inaczej przy każdym pytaniu, nie ma rozdzielczości czterech miejsc po przecinku”.
Z raportu Oloproof z przebiegu, 23 września 2026

W skrócie

  • UruchomiłOloproof, z własnej inicjatywy
  • Oceniany systemDziałający asystent dokumentacji RAG, którego nie prowadzimy
  • Panel58 pytań, własnych pytań właścicieli, bez zmian
  • SędziaSędzia LLM, jeszcze niesprawdzony względem etykiet ludzkich
  • Data przebiegu22 i 23 września 2026
  • Przebiegi uzupełniające19 flag funkcji; 24 rozmowy

Czego to nie pokazuje

Jeden system, jeden korpus i panel za mały, by rozstrzygnąć własne pytanie. Sędzia stojący za każdym wynikiem odpowiedzi nie został zwalidowany względem ludzi, i diagnoza to mówi. Panel jest jednoturowy: przebieg uzupełniający z 24 rozmowami znalazł dwie powtarzalne porażki, których panele jednoturowe nie mogą wywołać, w tym asystenta zaprzeczającego temu, co powiedział turę wcześniej. To nie jest benchmark i to nie jest klient.