Untuk tim RAG dan retrieval
Ketahui apa dampak perubahan indeks Anda.
Perubahan retrieval menggeser kualitas dengan cara yang tidak bisa diperlihatkan oleh diff chunking. Oloproof menjalankan sistem RAG Anda sebagai dua tahap yang bisa dilihatnya, dan mengukur retrieval, sitasi, keberdasaran, dan kebenaran jawaban pada kasus yang sama, sebelum dan sesudah.
Ukur
Evaluator yang memahami retrieval
Hit rate, recall, MRR, dan nDCG pada cutoff pilihan Anda, dibaca dari kandidat yang tercatat; validitas sitasi terhadap konteks yang diberikan kepada model; juri keberdasaran dan dukungan sitasi yang membacanya. Cutoff yang lebih dalam daripada yang dikembalikan retriever ditolak, bukan dinilai sebagai meleset.
Isolasi
Satu tahap pada satu waktu
Setiap tahap di-cache tersendiri, jadi perubahan prompt tidak pernah mencari ulang. Diagnosis menjalankan ulang kasus gagal dengan passage yang benar di samping kontrol dan melabeli masing-masing sebagai retrieval meleset, tergeser dari peringkat, hilang dari konteks, atau kegagalan generasi.
Putuskan
Gerbang berdasarkan interval
Kandidat dan baseline dipasangkan kasus demi kasus terhadap margin yang Anda deklarasikan. Sebuah aturan lolos hanya jika intervalnya melewati margin; interval yang terlalu lebar untuk memastikan memblokir rilis sebagai bukti tidak cukup, dengan bukti disimpan di samping keputusan.
Hasil nyata
Halaman benar di peringkat 1
+6.2 poin
[−36.3, +45.5] · 48 berpasangan · belum terputuskan
Halaman benar di 3 teratas
+3.7 poin
[−73.9, +76.2] · 27 berpasangan · belum terputuskan
Jawaban benar
+6.5 poin
[−39.4, +48.4] · 46 berpasangan · belum terputuskan
Jika membaca estimasi titik, reranker menambah 12,7 poin halaman-benar-di-peringkat-1 dan akan dirilis. Dipasangkan pada pertanyaan yang dijawab kedua lengan, setiap interval melewati nol: panel ini tidak bisa menyatakan apakah reranker membantu atau merugikan, dan Oloproof mengatakannya alih-alih memilih pemenang. Baca laporan lapangan.