Dành cho các nhóm RAG và truy xuất
Biết thay đổi chỉ mục của bạn đã làm gì.
Thay đổi truy xuất làm dịch chuyển chất lượng theo những cách mà một bản diff chia đoạn không thể cho thấy. Oloproof chạy hệ thống RAG của bạn như hai giai đoạn mà nó nhìn thấy được, và đo truy xuất, trích dẫn, tính có căn cứ và độ đúng của câu trả lời trên cùng các trường hợp, trước và sau.
Đo lường
Bộ đánh giá hiểu truy xuất
Tỷ lệ trúng, recall, MRR và nDCG ở ngưỡng cắt bạn chọn, đọc từ các ứng viên đã ghi lại; tính hợp lệ của trích dẫn so với ngữ cảnh mà mô hình được cung cấp; các giám khảo về tính có căn cứ và mức hỗ trợ trích dẫn đọc ngữ cảnh đó. Ngưỡng cắt sâu hơn số kết quả bộ truy xuất trả về sẽ bị từ chối, không bị chấm là trượt.
Tách riêng
Từng giai đoạn một
Mỗi giai đoạn được lưu bộ nhớ đệm riêng, nên thay đổi prompt không bao giờ phải tìm kiếm lại. Chẩn đoán chạy lại các trường hợp thất bại với đoạn văn chuẩn bên cạnh một nhóm đối chứng và gắn nhãn mỗi trường hợp là truy xuất bỏ sót, bị đẩy khỏi thứ hạng, bị rơi khỏi ngữ cảnh, hoặc lỗi tạo sinh.
Quyết định
Cổng dựa trên khoảng
Phiên bản ứng viên và phiên bản cơ sở được ghép cặp theo từng trường hợp với các biên mà bạn khai báo. Một quy tắc chỉ đạt khi khoảng của nó vượt qua biên; một khoảng quá rộng để kết luận sẽ chặn bản phát hành vì không đủ bằng chứng, và bằng chứng được lưu cạnh quyết định.
Một kết quả thật
Trang đúng ở hạng 1
+6.2 điểm
[−36.3, +45.5] · 48 cặp · chưa kết luận
Trang đúng trong top 3
+3.7 điểm
[−73.9, +76.2] · 27 cặp · chưa kết luận
Câu trả lời đúng
+6.5 điểm
[−39.4, +48.4] · 46 cặp · chưa kết luận
Nếu đọc theo ước lượng điểm, reranker tăng 12,7 điểm cho chỉ số trang đúng ở hạng 1 và lẽ ra đã được phát hành. Ghép cặp trên những câu hỏi mà cả hai nhánh đều trả lời, mọi khoảng đều cắt qua mức không: bộ mẫu này không thể nói reranker giúp ích hay gây hại, và Oloproof nói rõ điều đó thay vì chọn ra người thắng. Đọc báo cáo thực tế.