Báo cáo thực tế · lần chạy của chính chúng tôi
Reranker trông như một cải thiện. Bằng chứng không thể khẳng định.
Chúng tôi chạy Oloproof trên một trợ lý tài liệu tạo sinh tăng cường truy xuất đang hoạt động mà chúng tôi không vận hành: bộ truy xuất và chỉ mục riêng của nó, tạo sinh thật, một giám khảo LLM và bộ mẫu chuẩn 58 câu hỏi của chủ sở hữu, giữ nguyên. Không có khách hàng nào liên quan. Đây là lần chạy của chúng tôi, được báo cáo đúng như chúng tôi đã kiểm định.
- 58
- câu hỏi trong bộ mẫu chuẩn của chủ sở hữu
- 0 trên 76
- phép so sánh feature flag đi đến kết luận
- 1 trên 9
- trường hợp đổi phán quyết giữa các lần chạy giống hệt nhau
- 15 trên 23
- câu trả lời thất bại được khôi phục nhờ đoạn văn chuẩn
Bật rerank so với tắt rerank, 22 tháng 9 năm 2026
| Chỉ số | Bật rerank | Tắt rerank | Chênh lệch ghép cặp, bật trừ tắt |
|---|---|---|---|
| Trang đúng ở hạng 1 | 0.745 [0.519, 0.875] · 51 trên 58 | 0.618 [0.449, 0.760] · 55 trên 58 | +6.2 điểm [−36.3, +45.5] · 48 cặp |
| Trang đúng trong top 3 | 0.742 [0.270, 0.939] · 31 trên 58 | 0.683 [0.350, 0.875] · 41 trên 58 | +3.7 điểm [−73.9, +76.2] · 27 cặp |
| Trả lời đúng (giám khảo LLM) | 0.760 [0.519, 0.888] · 50 trên 58 | 0.685 [0.501, 0.819] · 54 trên 58 | +6.5 điểm [−39.4, +48.4] · 46 cặp |
Trước
Trợ lý này đã có một bộ khung kiểm thử khá tốt: một bộ mẫu chuẩn, một giám khảo LLM và một cổng phát hành. Cổng so sánh một ước lượng điểm với một mục tiêu, ở mọi cỡ bộ mẫu. Đọc theo cách đó, reranker tăng 12,7 điểm cho chỉ số trang đúng ở hạng 1 và lẽ ra đã được phát hành. Hơn nữa, trong điểm trung thực dùng làm cổng phát hành, một câu trả lời mà giám khảo không chấm được bị tính là thất bại hoàn toàn.
Sau
Oloproof ghép cặp hai nhánh trên những câu hỏi mà cả hai đều đã trả lời, ghi nhận 4 lỗi máy chủ và 2 phán quyết không phân tích được là dữ liệu thiếu, và nới rộng từng khoảng để bao trọn chúng. Cả ba chênh lệch đều cắt qua mức không, với biên độ rộng: bộ mẫu này không thể nói reranker giúp ích hay gây hại.
Chạy lại 23 câu trả lời thất bại với đoạn văn chuẩn thay cho đoạn được truy xuất đã khôi phục 15 câu, bên cạnh một nhóm đối chứng chạy lại chúng mà không thay đổi gì. Chẩn đoán gắn nhãn 5 trường hợp truy xuất bỏ sót, 7 trường hợp lỗi tạo sinh, để lại 11 trường hợp chưa xác định, và chỉ ra độ sâu truy xuất cùng cấu hình chỉ mục là các thí nghiệm tiếp theo.
Đo lại ba lần, khoảng một trong chín trường hợp đổi phán quyết dù không có gì thay đổi, và 13,8% số lệnh gọi trả về lỗi máy chủ. Khai báo các lỗi đó là tạm thời đã khôi phục 18 trên 22 trường hợp thiếu và thu hẹp khoảng đi 39%. Sau đó, một lượt quét qua mười chín feature flag của trợ lý cho ra 76 phép so sánh ghép cặp, không phép nào đi đến kết luận, và thêm khoảng 40 câu hỏi nữa sẽ đủ để kết luận ba phép triển vọng nhất.
“Một bộ kiểm thử 58 trường hợp, trong đó cứ chín trường hợp lại có một trả lời khác đi mỗi lần được hỏi, không có độ phân giải đến bốn chữ số thập phân.”
Tóm tắt
- Thực hiện bởiOloproof, tự chủ động
- Hệ thống được đánh giáMột trợ lý tài liệu RAG đang hoạt động mà chúng tôi không vận hành
- Bộ mẫu58 câu hỏi, của chính chủ sở hữu, giữ nguyên
- Giám khảoMột giám khảo LLM, chưa được đối chiếu với nhãn của con người
- Ngày chạy22 và 23 tháng 9 năm 2026
- Các lần chạy tiếp theo19 feature flag; 24 cuộc hội thoại
Những gì nó không cho thấy
Một hệ thống, một kho ngữ liệu, và một bộ mẫu quá nhỏ để trả lời chính câu hỏi của nó. Giám khảo đứng sau mọi điểm câu trả lời chưa được kiểm chứng với con người, và chẩn đoán nói rõ điều đó. Bộ mẫu là đơn lượt: một lần chạy tiếp theo với 24 cuộc hội thoại đã tìm ra hai lỗi tái lập được mà bộ mẫu đơn lượt không thể tạo ra, trong đó có một trợ lý phủ nhận điều nó vừa nói ở lượt trước. Đây không phải là benchmark, và không phải là khách hàng.