面向 RAG 与检索团队
弄清你的索引变更到底带来了什么。
检索变更对质量的影响,是分块的 diff 看不出来的。Oloproof 把你的 RAG 系统作为它能看到的两个阶段来运行,并在变更前后用同一批用例衡量检索、引用、有据性和回答正确性。
衡量
感知检索的评估器
在你选择的截断位置计算命中率、召回率、MRR 和 nDCG,数据读自记录下的候选结果;依据模型实际获得的上下文检查引用有效性;以及读取该上下文的有据性评判器和引用支持评判器。比检索器实际返回更深的截断位置会被拒绝,而不是记为未命中。
隔离
一次一个阶段
每个阶段单独缓存,因此修改提示词永远不会重新检索。诊断会用黄金段落重新运行失败用例,旁边设有对照组,并将每个用例标记为检索遗漏、排名靠后被挤出、从上下文中丢失,或生成失败。
决策
依据区间进行门控
候选版本与基线逐个用例配对,对照你声明的容差。只有当规则的区间越过容差时它才通过;区间宽到无法判断时,发布会以证据不足为由被阻止,证据与决策保存在一起。
一个真实的结果
排名第 1 的页面正确
+6.2 个百分点
[−36.3, +45.5] · 48 对配对 · 未定
正确页面位于前 3
+3.7 个百分点
[−73.9, +76.2] · 27 对配对 · 未定
答案正确
+6.5 个百分点
[−39.4, +48.4] · 46 对配对 · 未定
只看点估计,重排序器让“第 1 位即为正确页面”提高了 12.7 个百分点,本会被发布上线。在两组都已回答的问题上配对后,每个区间都跨过零:这个测试集无法判断重排序器是有益还是有害,Oloproof 会如实说明,而不是挑出一个赢家。 阅读实地报告.