Dla zespołów RAG i wyszukiwania
Dowiedz się, co zrobiła zmiana indeksu.
Zmiany w wyszukiwaniu przesuwają jakość w sposób, którego diff podziału na fragmenty nie pokaże. Oloproof uruchamia Twój system RAG jako dwa etapy, które widzi, i mierzy wyszukiwanie, cytowania, ugruntowanie i poprawność odpowiedzi na tych samych przypadkach, przed i po.
Mierz
Ewaluatory świadome wyszukiwania
Hit rate, recall, MRR i nDCG przy wybranym progu odcięcia, odczytane z zapisanych kandydatów; poprawność cytowań względem kontekstu, który dostał model; sędziowie ugruntowania i poparcia cytowań, którzy go czytają. Próg głębszy niż to, co zwrócił retriever, jest odrzucany, a nie liczony jako chybienie.
Izoluj
Jeden etap naraz
Każdy etap jest buforowany osobno, więc zmiana promptu nigdy nie wyszukuje ponownie. Diagnoza ponownie uruchamia błędne przypadki z właściwym fragmentem obok próby kontrolnej i oznacza każdy jako chybione wyszukiwanie, wypadnięcie z rankingu, utratę z kontekstu lub błąd generowania.
Decyduj
Bramka na podstawie przedziału
Kandydat i wersja bazowa są parowane przypadek po przypadku względem zadeklarowanych marginesów. Reguła przechodzi tylko wtedy, gdy jej przedział przekracza margines; przedział zbyt szeroki, by coś rozstrzygnąć, blokuje wydanie jako niewystarczające dowody, a dowody są przechowywane obok decyzji.
Prawdziwy wynik
Właściwa strona na pozycji 1
+6.2 pkt proc.
[−36.3, +45.5] · 48 w parach · nierozstrzygnięte
Właściwa strona w pierwszej 3
+3.7 pkt proc.
[−73.9, +76.2] · 27 w parach · nierozstrzygnięte
Odpowiedź poprawna
+6.5 pkt proc.
[−39.4, +48.4] · 46 w parach · nierozstrzygnięte
Odczytując estymacje punktowe, reranker dodawał 12,7 pkt proc. do „właściwej strony na pozycji 1” i trafiłby do wydania. Po sparowaniu na pytaniach, na które odpowiedziały oba ramiona, każdy przedział przecina zero: ten panel nie może stwierdzić, czy reranker pomaga, czy szkodzi, i Oloproof to mówi, zamiast wybierać zwycięzcę. Przeczytaj raport z praktyki.