RAG と検索のチーム向け
インデックスの変更が何をもたらしたかを知る。
検索の変更は、チャンク分割の diff では見えない形で品質を動かします。Oloproof は RAG システムを自ら観測できる 2 つの段階として実行し、検索、引用、根拠性、回答の正しさを、変更の前後で同じケースに対して測定します。
測定
検索を理解する評価器
記録された候補から、選んだカットオフでのヒット率、再現率、MRR、nDCG を読み取ります。モデルに与えられたコンテキストに照らした引用の妥当性、そしてそのコンテキストを読む根拠性ジャッジと引用裏付けジャッジ。リトリーバーが返した件数より深いカットオフは、取りこぼしとして採点されるのではなく、拒否されます。
切り分け
一度に 1 段階
各段階は個別にキャッシュされるので、プロンプトを変えても検索がやり直されることはありません。診断は失敗したケースを正解パッセージで対照と並べて再実行し、それぞれを検索の取りこぼし、順位外、コンテキストからの脱落、生成の失敗のいずれかにラベル付けします。
判定
区間でゲートする
候補とベースラインは、宣言したマージンに対してケースごとに対応づけられます。ルールが通過するのは区間がマージンを超えたときだけです。判断できないほど広い区間は、エビデンス不十分としてリリースを止め、エビデンスは判定と並べて保存されます。
実際の結果
1 位が正しいページ
+6.2 ポイント
[−36.3, +45.5] · 48 件で対応 · 未決
上位 3 件に正しいページ
+3.7 ポイント
[−73.9, +76.2] · 27 件で対応 · 未決
回答が正しい
+6.5 ポイント
[−39.4, +48.4] · 46 件で対応 · 未決
点推定値で読めば、リランカーは「1 位が正しいページ」を 12.7 ポイント押し上げ、そのままリリースされていたはずです。両アームが回答した質問で対応づけると、どの区間もゼロをまたぎます。このパネルではリランカーが役立つのか害になるのかを判断できず、Oloproof は勝者を選ぶ代わりにそう伝えます。 フィールドレポートを読む.