Skip to content
← Semua tulisan

Skor eval Anda berbohong soal ukuran sampel

Satu rata-rata tunggal adalah cara paling umum tim membohongi diri sendiri tentang perubahan AI. Inilah yang kami laporkan sebagai gantinya, dan mengapa interval harus ditaruh di depan angkanya.

Ambil golden panel berisi 58 kasus dan asisten dokumentasi yang berjalan sungguhan dan menjawab dari indeks pencarian nyata, lalu bandingkan saat reranker-nya aktif dan nonaktif. Jika membaca estimasi titik, reranker menaikkan porsi jawaban yang halaman peringkat teratasnya benar dari 61,8% menjadi 74,5%. Itu terbaca seperti kemajuan, dan dalam laporan status biasanya dilaporkan sebagai kenaikan 12,7 poin.

Jalankan lengan yang sama dua kali tanpa mengubah apa pun, dan ketepatan jawaban keluar 71,2%, lalu 76,0%. Diukur lagi dengan tiga replikasi per kasus, sekitar satu dari sembilan kasus yang teramati berubah putusan di antara pengukuran yang identik: 6 dari 54 pada ketepatan, 7 dari 57 pada halaman peringkat teratas.

Alasannya bukan karena pengukurannya rusak. Melainkan karena selisih pada 58 kasus, yang sebagian sama sekali tidak dapat diukur, masih jauh berada di dalam derau yang dapat dihasilkan sampel itu sendiri. Interval, bukan estimasi titik, yang memberi tahu apakah Anda mempelajari sesuatu.

Apa yang perlu dilaporkan

Tiga angka, dalam urutan ini: selisihnya, intervalnya, dan jumlah kasus di baliknya. Kurang dari itu, pembaca tidak dapat menilai klaimnya. Berikut eksekusi tersebut, reranker aktif dibandingkan reranker nonaktif, dipasangkan kasus demi kasus, dalam poin:

Selisih berpasangan, reranker aktif dikurangi reranker nonaktif, pada panel 58 kasus
Kasus berpasanganMetrikSelisihInterval 95%Dibaca sebagai
48Halaman benar di peringkat 1+6.2−36.3 … +45.5Tidak konklusif
46Jawaban benar+6.5−39.4 … +48.4Tidak konklusif
27Halaman benar di 3 teratas+3.7−73.9 … +76.2Tidak konklusif

Setiap interval melewati nol, dan jauh. Estimasi titik semuanya menyatakan reranker membantu; interval menyatakan panel ini tidak dapat mengetahui apakah reranker membantu atau merugikan. Itu temuan tersendiri: panel ini terlalu kecil, dan terlalu banyak kehilangan data, untuk menjawab pertanyaan yang hendak dijawab dengannya.

Hilang bukan berarti nol

Empat dari 58 panggilan mengembalikan HTTP 500 dari sistem yang diuji, dan dua panggilan juri tidak mengembalikan putusan yang dapat diurai. Harness yang merata-ratakan kasus tanpa nilai sebagai nol mencatat keenamnya sebagai kegagalan asisten: enam kegagalan buatan dari 58. Oloproof mencatatnya sebagai hilang dan melebarkan interval agar mencakup nilai apa pun yang mungkin dimilikinya.

Itulah yang diperhitungkan oleh baris ketiga. Hanya 27 dari 58 kasus yang dapat diukur pada batas tiga halaman berperingkat, dan interval memperhitungkan 31 sisanya alih-alih menyembunyikannya.

Panel kecil lolos gerbang

Aturan yang sama berlaku di ujung yang kecil. Eksekusi smoke berisi tiga kasus mendapat skor 1,000, dengan interval 95% dari 0,292 hingga 1,000. Gerbang yang membandingkan estimasi titik dengan target akan merilisnya. Gerbang yang membaca interval menyatakan yang sebenarnya: tiga kasus tidak dapat membedakan sistem yang sempurna dari sistem yang benar tiga kali dari sepuluh.

Mempersempit interval

Lebih banyak kasus mempersempit interval, begitu pula kehilangan lebih sedikit kasus. Pada panel yang sama, menyatakan HTTP 500 sistem sebagai sementara, sehingga runner mencobanya ulang, memulihkan 18 dari 22 kasus yang hilang dan mempersempit interval sebesar 39%, beberapa menit kemudian, tanpa perubahan lain.

Selisih yang intervalnya melampaui ambang batas mendukung sebuah keputusan, berapa pun besarnya, dan itulah yang seharusnya ditindaklanjuti gerbang. Sampai saat itu, laporkan selisihnya, intervalnya, dan kasus di baliknya, dan katakan bahwa jawabannya belum ada.

Ingin ini dihitung untuk Anda di setiap perubahan?

Hubungi kami