Skip to content

Báo cáo thực tế · lần chạy của chính chúng tôi

Reranker trông như một cải thiện. Bằng chứng không thể khẳng định.

Chúng tôi chạy Oloproof trên một trợ lý tài liệu tạo sinh tăng cường truy xuất đang hoạt động mà chúng tôi không vận hành: bộ truy xuất và chỉ mục riêng của nó, tạo sinh thật, một giám khảo LLM và bộ mẫu chuẩn 58 câu hỏi của chủ sở hữu, giữ nguyên. Không có khách hàng nào liên quan. Đây là lần chạy của chúng tôi, được báo cáo đúng như chúng tôi đã kiểm định.

58
câu hỏi trong bộ mẫu chuẩn của chủ sở hữu
0 trên 76
phép so sánh feature flag đi đến kết luận
1 trên 9
trường hợp đổi phán quyết giữa các lần chạy giống hệt nhau
15 trên 23
câu trả lời thất bại được khôi phục nhờ đoạn văn chuẩn

Bật rerank so với tắt rerank, 22 tháng 9 năm 2026

So sánh reranker: tỷ lệ của từng nhánh với khoảng 95% và số lượng quan sát, cùng chênh lệch ghép cặp
Chỉ sốBật rerankTắt rerankChênh lệch ghép cặp, bật trừ tắt
Trang đúng ở hạng 10.745 [0.519, 0.875] · 51 trên 580.618 [0.449, 0.760] · 55 trên 58+6.2 điểm [−36.3, +45.5] · 48 cặp
Trang đúng trong top 30.742 [0.270, 0.939] · 31 trên 580.683 [0.350, 0.875] · 41 trên 58+3.7 điểm [−73.9, +76.2] · 27 cặp
Trả lời đúng (giám khảo LLM)0.760 [0.519, 0.888] · 50 trên 580.685 [0.501, 0.819] · 54 trên 58+6.5 điểm [−39.4, +48.4] · 46 cặp

Trước

Trợ lý này đã có một bộ khung kiểm thử khá tốt: một bộ mẫu chuẩn, một giám khảo LLM và một cổng phát hành. Cổng so sánh một ước lượng điểm với một mục tiêu, ở mọi cỡ bộ mẫu. Đọc theo cách đó, reranker tăng 12,7 điểm cho chỉ số trang đúng ở hạng 1 và lẽ ra đã được phát hành. Hơn nữa, trong điểm trung thực dùng làm cổng phát hành, một câu trả lời mà giám khảo không chấm được bị tính là thất bại hoàn toàn.

Sau

Oloproof ghép cặp hai nhánh trên những câu hỏi mà cả hai đều đã trả lời, ghi nhận 4 lỗi máy chủ và 2 phán quyết không phân tích được là dữ liệu thiếu, và nới rộng từng khoảng để bao trọn chúng. Cả ba chênh lệch đều cắt qua mức không, với biên độ rộng: bộ mẫu này không thể nói reranker giúp ích hay gây hại.

Chạy lại 23 câu trả lời thất bại với đoạn văn chuẩn thay cho đoạn được truy xuất đã khôi phục 15 câu, bên cạnh một nhóm đối chứng chạy lại chúng mà không thay đổi gì. Chẩn đoán gắn nhãn 5 trường hợp truy xuất bỏ sót, 7 trường hợp lỗi tạo sinh, để lại 11 trường hợp chưa xác định, và chỉ ra độ sâu truy xuất cùng cấu hình chỉ mục là các thí nghiệm tiếp theo.

Đo lại ba lần, khoảng một trong chín trường hợp đổi phán quyết dù không có gì thay đổi, và 13,8% số lệnh gọi trả về lỗi máy chủ. Khai báo các lỗi đó là tạm thời đã khôi phục 18 trên 22 trường hợp thiếu và thu hẹp khoảng đi 39%. Sau đó, một lượt quét qua mười chín feature flag của trợ lý cho ra 76 phép so sánh ghép cặp, không phép nào đi đến kết luận, và thêm khoảng 40 câu hỏi nữa sẽ đủ để kết luận ba phép triển vọng nhất.

“Một bộ kiểm thử 58 trường hợp, trong đó cứ chín trường hợp lại có một trả lời khác đi mỗi lần được hỏi, không có độ phân giải đến bốn chữ số thập phân.”
Trích từ báo cáo của Oloproof về lần chạy, 23 tháng 9 năm 2026

Tóm tắt

  • Thực hiện bởiOloproof, tự chủ động
  • Hệ thống được đánh giáMột trợ lý tài liệu RAG đang hoạt động mà chúng tôi không vận hành
  • Bộ mẫu58 câu hỏi, của chính chủ sở hữu, giữ nguyên
  • Giám khảoMột giám khảo LLM, chưa được đối chiếu với nhãn của con người
  • Ngày chạy22 và 23 tháng 9 năm 2026
  • Các lần chạy tiếp theo19 feature flag; 24 cuộc hội thoại

Những gì nó không cho thấy

Một hệ thống, một kho ngữ liệu, và một bộ mẫu quá nhỏ để trả lời chính câu hỏi của nó. Giám khảo đứng sau mọi điểm câu trả lời chưa được kiểm chứng với con người, và chẩn đoán nói rõ điều đó. Bộ mẫu là đơn lượt: một lần chạy tiếp theo với 24 cuộc hội thoại đã tìm ra hai lỗi tái lập được mà bộ mẫu đơn lượt không thể tạo ra, trong đó có một trợ lý phủ nhận điều nó vừa nói ở lượt trước. Đây không phải là benchmark, và không phải là khách hàng.