Skip to content
← Wszystkie artykuły

Twoje wyniki ewaluacji kłamią co do wielkości próby

Pojedyncza średnia to najczęstszy sposób, w jaki zespoły oszukują same siebie co do zmiany w AI. Oto co raportujemy zamiast niej i dlaczego przedział powinien stać przed liczbą.

Weź złoty panel 58 przypadków i działającego asystenta dokumentacji, który odpowiada na podstawie prawdziwego indeksu wyszukiwania, i porównaj go z włączonym i wyłączonym rerankerem. Według estymacji punktowych reranker podnosi odsetek odpowiedzi, w których najwyżej oceniona strona jest właściwa, z 61,8% do 74,5%. Wygląda to na postęp i w raporcie o stanie zwykle zostaje opisane jako zysk 12,7 punktu.

Uruchom to samo ramię dwa razy bez żadnej zmiany, a poprawność odpowiedzi wyniosła 71,2%, a potem 76,0%. Przy ponownym pomiarze z trzema powtórzeniami na przypadek mniej więcej co dziewiąty obserwowany przypadek zmieniał werdykt między identycznymi pomiarami: 6 z 54 dla poprawności, 7 z 57 dla najwyżej ocenionej strony.

Powodem nie jest to, że pomiar jest zepsuty. Chodzi o to, że różnica na 58 przypadkach, z których części nie dało się w ogóle zmierzyć, mieści się głęboko w szumie, który próba potrafi wytworzyć sama. To przedział, a nie estymacja punktowa, mówi, czy czegoś się dowiedziałeś.

Co raportować

Trzy liczby, w tej kolejności: różnica, jej przedział i liczba przypadków, na których się opiera. Przy mniejszej liczbie czytelnik nie może ocenić twierdzenia. Oto ten przebieg, reranker włączony względem wyłączonego, sparowany przypadek po przypadku, w punktach:

Różnice sparowane, reranker włączony minus reranker wyłączony, na panelu 58 przypadków
Sparowane przypadkiMetrykaRóżnicaPrzedział 95%Wniosek
48Właściwa strona na pozycji 1+6.2−36.3 … +45.5Nierozstrzygnięte
46Odpowiedź poprawna+6.5−39.4 … +48.4Nierozstrzygnięte
27Właściwa strona w pierwszej 3+3.7−73.9 … +76.2Nierozstrzygnięte

Każdy przedział przecina zero, i to szeroko. Estymacje punktowe mówią zgodnie, że reranker pomaga; przedziały mówią, że ten panel nie potrafi stwierdzić, czy pomaga, czy szkodzi. To samo w sobie jest ustaleniem: panel jest za mały i traci zbyt wiele przypadków, by rozstrzygnąć pytanie, do którego go używano.

Brak to nie zero

Cztery z 58 wywołań zwróciły HTTP 500 z testowanego systemu, a dwa wywołania sędziego nie zwróciły werdyktu, który dałoby się sparsować. Harness, który uśrednia nieocenioną odpowiedź jako zero, zapisuje te sześć jako porażki asystenta: sześć sfabrykowanych porażek na 58. Oloproof zapisuje je jako brakujące i poszerza przedział, aby objąć cokolwiek mogłyby wynieść.

To właśnie wycenia trzeci wiersz. Tylko 27 z 58 przypadków dało się zmierzyć przy odcięciu na trzech rankingowanych stronach, a przedział uwzględnia pozostałe 31, zamiast je ukrywać.

Małe panele przechodzą przez bramki

Ta sama zasada obowiązuje na małym końcu. Przebieg dymny na trzech przypadkach uzyskał 1,000, z przedziałem 95% od 0,292 do 1,000. Bramka, która porównuje estymację punktową z celem, przepuszcza go. Bramka, która czyta przedział, mówi prawdę: trzy przypadki nie odróżnią systemu doskonałego od takiego, który ma rację trzy razy na dziesięć.

Zawężanie przedziału

Przedział zawężają więcej przypadków, a także mniejsza liczba utraconych. Na tym samym panelu odpowiedzi HTTP 500 systemu zadeklarowano jako przejściowe, tak aby runner ponawiał je; to odzyskało 18 z 22 brakujących przypadków i zawęziło przedział o 39%, kilka minut później, bez żadnej innej zmiany.

Różnica, której przedział przekracza próg, uzasadnia decyzję bez względu na jej wielkość, i to na nią powinna reagować bramka. Do tego czasu raportuj różnicę, jej przedział i przypadki, na których się opiera, i mów, że odpowiedzi jeszcze nie ma.

Chcesz, żeby było to liczone dla Ciebie przy każdej zmianie?

Skontaktuj się z nami