Weź złoty panel 58 przypadków i działającego asystenta dokumentacji, który odpowiada na podstawie prawdziwego indeksu wyszukiwania, i porównaj go z włączonym i wyłączonym rerankerem. Według estymacji punktowych reranker podnosi odsetek odpowiedzi, w których najwyżej oceniona strona jest właściwa, z 61,8% do 74,5%. Wygląda to na postęp i w raporcie o stanie zwykle zostaje opisane jako zysk 12,7 punktu.
Uruchom to samo ramię dwa razy bez żadnej zmiany, a poprawność odpowiedzi wyniosła 71,2%, a potem 76,0%. Przy ponownym pomiarze z trzema powtórzeniami na przypadek mniej więcej co dziewiąty obserwowany przypadek zmieniał werdykt między identycznymi pomiarami: 6 z 54 dla poprawności, 7 z 57 dla najwyżej ocenionej strony.
Powodem nie jest to, że pomiar jest zepsuty. Chodzi o to, że różnica na 58 przypadkach, z których części nie dało się w ogóle zmierzyć, mieści się głęboko w szumie, który próba potrafi wytworzyć sama. To przedział, a nie estymacja punktowa, mówi, czy czegoś się dowiedziałeś.
Co raportować
Trzy liczby, w tej kolejności: różnica, jej przedział i liczba przypadków, na których się opiera. Przy mniejszej liczbie czytelnik nie może ocenić twierdzenia. Oto ten przebieg, reranker włączony względem wyłączonego, sparowany przypadek po przypadku, w punktach:
| Sparowane przypadki | Metryka | Różnica | Przedział 95% | Wniosek |
|---|---|---|---|---|
| 48 | Właściwa strona na pozycji 1 | +6.2 | −36.3 … +45.5 | Nierozstrzygnięte |
| 46 | Odpowiedź poprawna | +6.5 | −39.4 … +48.4 | Nierozstrzygnięte |
| 27 | Właściwa strona w pierwszej 3 | +3.7 | −73.9 … +76.2 | Nierozstrzygnięte |
Każdy przedział przecina zero, i to szeroko. Estymacje punktowe mówią zgodnie, że reranker pomaga; przedziały mówią, że ten panel nie potrafi stwierdzić, czy pomaga, czy szkodzi. To samo w sobie jest ustaleniem: panel jest za mały i traci zbyt wiele przypadków, by rozstrzygnąć pytanie, do którego go używano.
Brak to nie zero
Cztery z 58 wywołań zwróciły HTTP 500 z testowanego systemu, a dwa wywołania sędziego nie zwróciły werdyktu, który dałoby się sparsować. Harness, który uśrednia nieocenioną odpowiedź jako zero, zapisuje te sześć jako porażki asystenta: sześć sfabrykowanych porażek na 58. Oloproof zapisuje je jako brakujące i poszerza przedział, aby objąć cokolwiek mogłyby wynieść.
To właśnie wycenia trzeci wiersz. Tylko 27 z 58 przypadków dało się zmierzyć przy odcięciu na trzech rankingowanych stronach, a przedział uwzględnia pozostałe 31, zamiast je ukrywać.
Małe panele przechodzą przez bramki
Ta sama zasada obowiązuje na małym końcu. Przebieg dymny na trzech przypadkach uzyskał 1,000, z przedziałem 95% od 0,292 do 1,000. Bramka, która porównuje estymację punktową z celem, przepuszcza go. Bramka, która czyta przedział, mówi prawdę: trzy przypadki nie odróżnią systemu doskonałego od takiego, który ma rację trzy razy na dziesięć.
Zawężanie przedziału
Przedział zawężają więcej przypadków, a także mniejsza liczba utraconych. Na tym samym panelu odpowiedzi HTTP 500 systemu zadeklarowano jako przejściowe, tak aby runner ponawiał je; to odzyskało 18 z 22 brakujących przypadków i zawęziło przedział o 39%, kilka minut później, bez żadnej innej zmiany.
Różnica, której przedział przekracza próg, uzasadnia decyzję bez względu na jej wielkość, i to na nią powinna reagować bramka. Do tego czasu raportuj różnicę, jej przedział i przypadki, na których się opiera, i mów, że odpowiedzi jeszcze nie ma.
Chcesz, żeby było to liczone dla Ciebie przy każdej zmianie?
Skontaktuj się z nami