Skip to content

フィールドレポート · 私たち自身の実行

リランカーは改善に見えた。エビデンスでは判断できなかった。

私たちは、自分たちが運用していない稼働中の検索拡張ドキュメントアシスタントに対して Oloproof を実行しました。そのアシスタント自身のリトリーバーとインデックス、実際の生成、LLM ジャッジ、そしてオーナーが用意した 58 問のゴールデンパネルをそのまま使っています。顧客は関与していません。これは私たちの実行であり、監査したとおりに報告します。

58
オーナーのゴールデンパネルの質問数
76 件中 0 件
結論が出たフィーチャーフラグ比較
9 件に 1 件
同一の実行間で判定が変わったケース
23 件中 15 件
正解パッセージで回復した失敗回答

リランクありとリランクなしの比較、2026 年 9 月 22 日

リランカーの比較:各アームの比率と 95% 区間、観測件数、および対応のある差
メトリクスリランクありリランクなし対応のある差(あり − なし)
1 位が正しいページ0.745 [0.519, 0.875] · 58 件中 51 件0.618 [0.449, 0.760] · 58 件中 55 件+6.2 ポイント [−36.3, +45.5] · 48 件で対応
上位 3 件に正しいページ0.742 [0.270, 0.939] · 58 件中 31 件0.683 [0.350, 0.875] · 58 件中 41 件+3.7 ポイント [−73.9, +76.2] · 27 件で対応
回答が正しい(LLM ジャッジ)0.760 [0.519, 0.888] · 58 件中 50 件0.685 [0.501, 0.819] · 58 件中 54 件+6.5 ポイント [−39.4, +48.4] · 46 件で対応

以前

このアシスタントにはすでに優れたハーネスがありました。ゴールデンパネル、LLM ジャッジ、そしてリリースゲートです。ゲートは、パネルの規模にかかわらず、点推定値を目標値と比べていました。その読み方では、リランカーは「1 位が正しいページ」を 12.7 ポイント押し上げ、そのままリリースされていたはずです。さらに、リリースのゲートに使われていた忠実性スコアでは、ジャッジが採点できなかった回答は完全な失敗として数えられていました。

以後

Oloproof は両アームが回答した質問で 2 つのアームを対応づけ、4 件のサーバーエラーと 2 件の解析不能な判定を欠損として記録し、それらを包含するよう各区間を広げました。3 つの差はいずれも大きくゼロをまたいでいます。このパネルでは、リランカーが役立つのか害になるのかを判断できません。

23 件の失敗回答を、検索されたパッセージの代わりに正解パッセージを入れて再実行したところ、15 件が回復しました。何も変えずに再実行する対照も並べています。診断は 5 件を検索の取りこぼし、7 件を生成の失敗とラベル付けし、11 件を未解決として残し、次の実験として検索の深さとインデックスの設定を挙げました。

3 回繰り返して測定すると、何も変えていないのに約 9 件に 1 件のケースで判定が変わり、呼び出しの 13.8% がサーバーエラーを返しました。これらのエラーを一時的なものと宣言すると、22 件の欠損ケースのうち 18 件が回復し、区間は 39% 狭まりました。続いてアシスタントの十九個のフィーチャーフラグを総当たりしたところ、76 件の対応のある比較が得られましたが、結論が出たものはひとつもなく、有望な上位 3 つに結論を出すにはあと約 40 問が必要です。

「58 ケースのスイートで、そのうち 9 件に 1 件が尋ねるたびに異なる答えを返すのなら、小数点以下 4 桁の分解能はない。」
Oloproof による実行レポートより、2026 年 9 月 23 日

概要

  • 実行者Oloproof(自主的に実施)
  • 評価対象のシステム私たちが運用していない稼働中の RAG ドキュメントアシスタント
  • パネル58 問、オーナー自身のもの、変更なし
  • ジャッジLLM ジャッジ、人手のラベルとの照合はまだ
  • 実行日2026 年 9 月 22 日と 23 日
  • 追加の実行19 個のフィーチャーフラグ、24 件の会話

示していないこと

1 つのシステム、1 つのコーパス、そして自らの問いに答えを出すには小さすぎるパネルです。すべての回答スコアの背後にあるジャッジは人による検証を受けておらず、診断もそう明記しています。パネルはシングルターンです。24 件の会話による追加の実行では、シングルターンのパネルでは起こりえない再現可能な失敗が 2 つ見つかりました。その中には、アシスタントが 1 ターン前に自分が言ったことを否定するものも含まれます。これはベンチマークではなく、顧客の事例でもありません。