Skip to content

Saha raporu · kendi çalıştırmamız

Reranker bir kazanç gibi görünüyordu. Kanıt bunu söyleyemedi.

Oloproof’u, işletmediğimiz canlı bir getirme destekli doküman asistanı üzerinde çalıştırdık: kendi retriever’ı ve indeksi, gerçek üretim, bir LLM hakemi ve sahiplerinin 58 soruluk referans paneli, değiştirilmeden. Hiçbir müşteri dahil değil. Bu bizim çalıştırmamız; denetlediğimiz haliyle raporlanıyor.

58
sahiplerin referans panelindeki soru
76 içinde 0
sonuçlanan feature flag karşılaştırması
9 vakada 1
özdeş çalıştırmalar arasında kararı değişen vaka
23 içinde 15
doğru pasajla kurtarılan başarısız yanıt

Reranking açık ile reranking kapalı, 22 Eylül 2026

Reranker karşılaştırması: her kolun oranı, %95 aralığı ve gözlenen sayısı ile eşleştirilmiş fark
MetrikReranking açıkReranking kapalıEşleştirilmiş fark, açık eksi kapalı
1. sırada doğru sayfa0.745 [0.519, 0.875] · 58 içinde 510.618 [0.449, 0.760] · 58 içinde 55+6.2 puan [−36.3, +45.5] · 48 eşleştirilmiş
İlk 3’te doğru sayfa0.742 [0.270, 0.939] · 58 içinde 310.683 [0.350, 0.875] · 58 içinde 41+3.7 puan [−73.9, +76.2] · 27 eşleştirilmiş
Yanıt doğru (LLM hakemi)0.760 [0.519, 0.888] · 58 içinde 500.685 [0.501, 0.819] · 58 içinde 54+6.5 puan [−39.4, +48.4] · 46 eşleştirilmiş

Önce

Asistanın zaten yetkin bir test düzeneği vardı: bir referans paneli, bir LLM hakemi ve bir sürüm kapısı. Kapı, her panel boyutunda bir nokta tahminini bir hedefle karşılaştırıyordu. Bu şekilde okunduğunda reranker, 1. sırada doğru sayfa metriğine 12,7 puan ekliyordu ve yayına alınacaktı. Üstelik sürümleri belirleyen sadakat puanında, hakemin puanlayamadığı bir yanıt tam bir başarısızlık sayılıyordu.

Sonra

Oloproof iki kolu, ikisinin de yanıtladığı sorular üzerinde eşleştirdi, 4 sunucu hatasını ve ayrıştırılamayan 2 kararı eksik olarak kaydetti ve her aralığı bunları kapsayacak şekilde genişletti. Üç farkın üçü de sıfırı geniş bir payla kesiyor: bu panel reranker’ın yardımcı mı yoksa zararlı mı olduğunu söyleyemez.

23 başarısız yanıtı, getirilen pasaj yerine doğru pasajla yeniden çalıştırmak 15’ini kurtardı; yanında da onları değiştirmeden yeniden çalıştıran bir kontrol vardı. Teşhis 5’ini getirme ıskası, 7’sini üretim hatası olarak etiketledi, 11’ini çözümsüz bıraktı ve sonraki deneyler olarak getirme derinliğini ve indeks yapılandırmasını gösterdi.

Üç kez ölçüldüğünde, hiçbir şey değişmeden kabaca her dokuz vakadan biri kararını değiştirdi ve çağrıların %13,8’i sunucu hatası döndürdü. Bu hataları geçici olarak bildirmek, 22 eksik vakanın 18’ini kurtardı ve aralığı %39 daralttı. Ardından asistanın on dokuz feature flag’i üzerinde yapılan bir tarama 76 eşleştirilmiş karşılaştırma verdi; hiçbiri sonuçlanmadı ve yaklaşık 40 soru daha en umut verici üçünü sonuçlandırırdı.

“58 vakalık, her dokuzundan biri her sorulduğunda farklı yanıt veren bir suite, dört ondalık basamaklık çözünürlüğe sahip değildir.”
Oloproof’un çalıştırma raporundan, 23 Eylül 2026

Bir bakışta

  • ÇalıştıranOloproof, kendi inisiyatifiyle
  • Değerlendirilen sistemİşletmediğimiz canlı bir RAG doküman asistanı
  • Panel58 soru, sahiplerin kendi soruları, değiştirilmeden
  • HakemBir LLM hakemi, henüz insan etiketleriyle karşılaştırılmadı
  • Çalıştırma tarihi22 ve 23 Eylül 2026
  • Takip çalıştırmaları19 feature flag; 24 konuşma

Neyi göstermediği

Tek bir sistem, tek bir derlem ve kendi sorusunu sonuçlandıramayacak kadar küçük bir panel. Her yanıt puanının arkasındaki hakem insanlara karşı doğrulanmadı ve teşhis bunu açıkça söylüyor. Panel tek turlu: 24 konuşmalık bir takip çalıştırması, tek turlu panellerin üretemeyeceği iki tekrarlanabilir başarısızlık buldu; bunlardan biri, asistanın bir tur önce söylediğini inkâr etmesiydi. Bu bir benchmark değil ve bir müşteri değil.