為 RAG 與檢索團隊打造
弄清楚你的索引變更到底帶來了什麼。
檢索變更對品質的影響,是分塊的 diff 看不出來的。Oloproof 把你的 RAG 系統當作它看得見的兩個階段來執行,並在變更前後用同一批案例衡量檢索、引用、有據性與回答正確性。
衡量
理解檢索的評估器
在你選擇的截斷位置計算命中率、召回率、MRR 與 nDCG,資料讀自記錄下來的候選結果;依據模型實際獲得的上下文檢查引用有效性;以及讀取該上下文的有據性評判器與引用支持評判器。比檢索器實際回傳更深的截斷位置會被拒絕,而不是記為未命中。
隔離
一次一個階段
每個階段各自快取,因此修改提示詞永遠不會重新檢索。診斷會以黃金段落重新執行失敗案例,旁邊設有對照組,並將每個案例標記為檢索遺漏、排名靠後被擠出、從上下文中遺失,或生成失敗。
決策
依據區間把關
候選版本與基準逐一案例配對,對照你宣告的容許差。只有當規則的區間越過容許差時它才通過;區間寬到無法判斷時,發布會以證據不足為由被阻擋,證據與決策保存在一起。
一個真實的結果
排名第 1 的頁面正確
+6.2 個百分點
[−36.3, +45.5] · 48 組配對 · 未定
正確頁面位於前 3
+3.7 個百分點
[−73.9, +76.2] · 27 組配對 · 未定
答案正確
+6.5 個百分點
[−39.4, +48.4] · 46 組配對 · 未定
只看點估計,重新排序器讓「第 1 名即為正確頁面」提高了 12.7 個百分點,原本會被發布上線。在兩組都已回答的問題上配對後,每個區間都跨越零:這個測試集無法判斷重新排序器是有幫助還是有害,Oloproof 會如實說明,而不是挑出一個贏家。 閱讀實地報告.