Skip to content
← Tüm yazılar

Değerlendirme puanlarınız örneklem büyüklüğü konusunda yalan söylüyor

Tek bir ortalama, ekiplerin bir yapay zekâ değişikliği konusunda kendilerini kandırmalarının en yaygın yoludur. İşte bunun yerine neyi raporladığımız ve aralığın neden sayının önünde yer alması gerektiği.

58 vakalık bir altın panel ve gerçek bir arama dizininden yanıt veren canlı bir dokümantasyon asistanı alın; onu reranker’ı açıkken ve kapalıyken karşılaştırın. Nokta tahminlerine bakılırsa reranker, en üst sıradaki sayfası doğru olan yanıtların payını %61,8’den %74,5’e çıkarıyor. Bu ilerleme gibi görünür ve bir durum raporunda genellikle 12,7 puanlık bir kazanç olarak aktarılır.

Hiçbir şeyi değiştirmeden aynı kolu iki kez çalıştırın: yanıt doğruluğu önce %71,2, sonra %76,0 çıktı. Vaka başına üç tekrarla yeniden ölçüldüğünde, gözlenen yaklaşık dokuz vakadan biri özdeş ölçümler arasında kararını değiştirdi: doğrulukta 54’te 6, en üst sıradaki sayfada 57’de 7.

Sebep ölçümün bozuk olması değil. Sebep, bir kısmı hiç ölçülemeyen 58 vaka üzerindeki bir farkın, örneklemin kendi başına üretebileceği gürültünün çok içinde kalması. Bir şey öğrenip öğrenmediğinizi nokta tahmini değil, aralık söyler.

Neyi raporlamalı

Bu sırayla üç sayı: fark, aralığı ve arkasındaki vaka sayısı. Daha azıyla okuyucu iddiayı değerlendiremez. İşte o çalıştırma, reranker açık ile reranker kapalı karşılaştırması, vaka vaka eşleştirilmiş, puan olarak:

Eşleştirilmiş farklar, reranker açık eksi reranker kapalı, 58 vakalık bir panelde
Eşleştirilmiş vakalarMetrikFark%95 aralığıOkunuşu
481. sırada doğru sayfa+6.2−36.3 … +45.5Sonuçsuz
46Yanıt doğru+6.5−39.4 … +48.4Sonuçsuz
27İlk 3’te doğru sayfa+3.7−73.9 … +76.2Sonuçsuz

Her aralık sıfırı, hem de geniş bir farkla kesiyor. Nokta tahminlerinin hepsi reranker’ın yardımcı olduğunu söylüyor; aralıklar ise bu panelin onun yardımcı mı yoksa zararlı mı olduğunu söyleyemeyeceğini söylüyor. Bu kendi başına bir bulgu: panel, çözmek için kullanıldığı soruyu çözemeyecek kadar küçük ve kayıplı.

Eksik, sıfır demek değildir

58 çağrının dördü test edilen sistemden HTTP 500 döndürdü ve iki hakem çağrısı ayrıştırılabilir bir karar döndürmedi. Notlanmamış bir vakayı sıfır olarak ortalamaya katan bir test düzeneği, bu altısını asistanın başarısızlığı olarak kaydeder: 58’de altı uydurma başarısızlık. Oloproof bunları eksik olarak kaydeder ve ne olabileceklerini sınırlamak için aralığı genişletir.

Üçüncü satırın fiyatladığı şey bu. 58 vakanın yalnızca 27’si, sıralanmış üç sayfalık bir kesimde ölçülebildi ve aralık diğer 31 vakayı gizlemek yerine hesaba katıyor.

Küçük paneller kapılardan geçer

Aynı kural küçük uçta da geçerli. Üç vakalık bir duman testi çalıştırması 1,000 puan aldı; %95 aralığı 0,292 ile 1,000 arasındaydı. Nokta tahminini bir hedefle karşılaştıran bir kapı onu yayına alır. Aralığı okuyan bir kapı doğruyu söyler: üç vaka, kusursuz bir sistemi ondan üçünde haklı çıkan bir sistemden ayırt edemez.

Aralığı daraltmak

Daha fazla vaka bir aralığı daraltır; daha azını kaybetmek de öyle. Aynı panelde, sistemin HTTP 500 hatalarını runner yeniden denesin diye geçici olarak beyan etmek, dakikalar sonra ve başka hiçbir şey değişmeden 22 eksik vakanın 18’ini geri kazandırdı ve aralığı %39 daralttı.

Aralığı eşiği aşan bir fark, büyüklüğü ne olursa olsun bir kararı destekler ve bir kapının harekete geçmesi gereken fark odur. O zamana kadar farkı, aralığını ve arkasındaki vakaları raporlayın ve yanıtın henüz netleşmediğini söyleyin.

Bunun her değişiklikte sizin için hesaplanmasını ister misiniz?

Bize ulaşın