Skip to content

Laporan lapangan · run kami sendiri

Reranker itu tampak seperti kemajuan. Buktinya tidak bisa memastikan.

Kami menjalankan Oloproof terhadap asisten dokumentasi berbasis retrieval-augmented generation yang sedang berjalan dan tidak kami operasikan: retriever dan indeksnya sendiri, generasi sungguhan, juri LLM, dan panel acuan 58 pertanyaan milik pemiliknya, tanpa diubah. Tidak ada pelanggan yang terlibat. Ini run kami, dilaporkan sebagaimana kami mengauditnya.

58
pertanyaan di panel acuan milik pemilik
0 dari 76
perbandingan feature flag yang terputuskan
1 dari 9
kasus yang berganti putusan di antara run yang identik
15 dari 23
jawaban gagal yang pulih dengan passage yang benar

Rerank aktif dibanding rerank nonaktif, 22 September 2026

Perbandingan reranker: tingkat tiap lengan dengan interval 95% dan jumlah teramati, serta selisih berpasangan
MetrikRerank aktifRerank nonaktifSelisih berpasangan, aktif dikurangi nonaktif
Halaman benar di peringkat 10.745 [0.519, 0.875] · 51 dari 580.618 [0.449, 0.760] · 55 dari 58+6.2 poin [−36.3, +45.5] · 48 berpasangan
Halaman benar di 3 teratas0.742 [0.270, 0.939] · 31 dari 580.683 [0.350, 0.875] · 41 dari 58+3.7 poin [−73.9, +76.2] · 27 berpasangan
Jawaban benar (juri LLM)0.760 [0.519, 0.888] · 50 dari 580.685 [0.501, 0.819] · 54 dari 58+6.5 poin [−39.4, +48.4] · 46 berpasangan

Sebelum

Asisten itu sudah punya harness yang cakap: panel acuan, juri LLM, dan gerbang rilis. Gerbang itu membandingkan estimasi titik dengan target, pada ukuran panel berapa pun. Dibaca seperti itu, reranker menambah 12,7 poin halaman-benar-di-peringkat-1 dan akan dirilis. Dan pada skor kesetiaan yang menjadi gerbang rilis, jawaban yang gagal dinilai oleh juri dihitung sebagai kegagalan total.

Sesudah

Oloproof memasangkan kedua lengan pada pertanyaan yang sama-sama dijawab keduanya, mencatat 4 error server dan 2 putusan yang tidak bisa diurai sebagai data hilang, dan melebarkan setiap interval untuk mencakupnya. Ketiga selisih melewati nol, dengan lebar: panel ini tidak bisa menyatakan apakah reranker membantu atau merugikan.

Menjalankan ulang 23 jawaban gagal dengan passage yang benar sebagai pengganti passage hasil retrieval memulihkan 15, di samping kontrol yang menjalankannya ulang tanpa perubahan. Diagnosis melabeli 5 sebagai retrieval yang meleset, 7 sebagai kegagalan generasi, membiarkan 11 tak terselesaikan, dan menyebut kedalaman retrieval serta konfigurasi indeks sebagai eksperimen berikutnya.

Diukur tiga kali, kira-kira satu dari sembilan kasus berganti putusan tanpa ada yang diubah, dan 13,8% panggilan mengembalikan error server. Menyatakan error itu sebagai sementara memulihkan 18 dari 22 kasus yang hilang dan menyempitkan interval sebesar 39%. Penyisiran atas sembilan belas feature flag asisten itu kemudian menghasilkan 76 perbandingan berpasangan, tidak satu pun terputuskan, dan sekitar 40 pertanyaan lagi akan memutuskan tiga yang paling menjanjikan.

“Suite berisi 58 kasus, yang satu dari sembilannya menjawab berbeda setiap kali ditanya, tidak memiliki resolusi empat angka desimal.”
Dari laporan Oloproof tentang run tersebut, 23 September 2026

Sekilas

  • Dijalankan olehOloproof, atas inisiatif sendiri
  • Sistem yang dievaluasiAsisten dokumentasi RAG yang sedang berjalan dan tidak kami operasikan
  • Panel58 pertanyaan, milik pemiliknya sendiri, tanpa diubah
  • JuriJuri LLM, belum dicek terhadap label manusia
  • Dijalankan pada22 dan 23 September 2026
  • Run lanjutan19 feature flag; 24 percakapan

Yang tidak ditunjukkannya

Satu sistem, satu korpus, dan panel yang terlalu kecil untuk menjawab pertanyaannya sendiri. Juri di balik setiap skor jawaban belum divalidasi terhadap manusia, dan diagnosisnya menyatakan hal itu. Panelnya satu giliran: run lanjutan berisi 24 percakapan menemukan dua kegagalan yang dapat direproduksi yang tidak mungkin muncul di panel satu giliran, termasuk asisten yang menyangkal apa yang ia katakan satu giliran sebelumnya. Ini bukan benchmark, dan ini bukan pelanggan.