Prendi un panel di riferimento di 58 casi e un assistente di documentazione reale che risponde da un vero indice di ricerca, e confrontalo con il reranker attivo e disattivato. Guardando le stime puntuali, il reranker porta la quota di risposte la cui pagina in cima alla classifica è quella giusta dal 61,8% al 74,5%. Sembra un progresso, e in un aggiornamento di stato di solito viene riportato come un guadagno di 12,7 punti.
Esegui lo stesso braccio due volte senza cambiare nulla e la correttezza delle risposte è risultata 71,2%, poi 76,0%. Misurato di nuovo con tre repliche per caso, circa un caso osservato su nove ha cambiato verdetto tra misurazioni identiche: 6 su 54 per la correttezza, 7 su 57 per la pagina in cima alla classifica.
Il motivo non è che la misurazione sia guasta. È che una differenza su 58 casi, alcuni dei quali non è stato affatto possibile misurare, sta ben dentro il rumore che il campione può produrre da solo. È l'intervallo, non la stima puntuale, a dirti se hai imparato qualcosa.
Cosa riportare
Tre numeri, in quest'ordine: la differenza, il suo intervallo e il numero di casi su cui si basa. Con meno di così un lettore non può giudicare l'affermazione. Ecco quell'esecuzione, reranker attivo contro reranker disattivato, appaiata caso per caso, in punti:
| Casi appaiati | Metrica | Differenza | Intervallo al 95% | Si legge come |
|---|---|---|---|---|
| 48 | Pagina giusta in posizione 1 | +6.2 | −36.3 … +45.5 | Non conclusivo |
| 46 | Risposta corretta | +6.5 | −39.4 … +48.4 | Non conclusivo |
| 27 | Pagina giusta tra le prime 3 | +3.7 | −73.9 … +76.2 | Non conclusivo |
Ogni intervallo attraversa lo zero, e di molto. Le stime puntuali dicono tutte che il reranker aiuta; gli intervalli dicono che questo panel non può stabilire se aiuta o peggiora. Questo è già un risultato: il panel è troppo piccolo, e perde troppi casi, per risolvere la questione per cui veniva usato.
Mancante non vuol dire zero
Quattro delle 58 chiamate hanno restituito HTTP 500 dal sistema sotto test, e due chiamate al giudice non hanno restituito alcun verdetto interpretabile. Un harness che fa la media di un caso non valutato come zero registra quei sei come fallimenti dell'assistente: sei fallimenti fabbricati su 58. Oloproof li registra come mancanti e allarga l'intervallo per coprire qualunque cosa avrebbero potuto essere.
È questo che la terza riga sta mettendo in conto. Solo 27 dei 58 casi si sono potuti misurare con un taglio a tre pagine in classifica, e l'intervallo tiene conto degli altri 31 invece di nasconderli.
I panel piccoli superano i gate
La stessa regola vale all'estremo piccolo. Un'esecuzione di smoke test su tre casi ha ottenuto 1,000, con un intervallo al 95% da 0,292 a 1,000. Un gate che confronta la stima puntuale con un obiettivo la rilascia. Un gate che legge l'intervallo dice come stanno le cose: tre casi non possono distinguere un sistema perfetto da uno che ha ragione tre volte su dieci.
Restringere l'intervallo
Più casi restringono un intervallo, e lo stesso fa perderne meno. Sullo stesso panel, dichiarare transitori gli HTTP 500 del sistema, così che il runner li riprovasse, ha recuperato 18 casi mancanti su 22 e ristretto l'intervallo del 39%, pochi minuti dopo, senza nient'altro di cambiato.
Una differenza il cui intervallo supera la soglia sostiene una decisione, qualunque sia la sua entità, ed è su quella che un gate dovrebbe agire. Fino ad allora, riporta la differenza, il suo intervallo e i casi su cui si basa, e di' che la risposta non c'è ancora.
Vuoi che venga calcolato per te a ogni modifica?
Contattaci