Skip to content
← Todos los artículos

Sus puntuaciones de evaluación mienten sobre el tamaño de la muestra

Un único promedio es la forma más común en que los equipos se engañan sobre un cambio en IA. Esto es lo que reportamos en su lugar, y por qué el intervalo va delante del número.

Tome un panel dorado de 58 casos y un asistente de documentación real que responde desde un índice de búsqueda real, y compárelo con su reranker activado y desactivado. Leyendo las estimaciones puntuales, el reranker eleva la proporción de respuestas cuya página mejor clasificada es la correcta del 61,8 % al 74,5 %. Eso parece un avance, y en un informe de estado suele presentarse como una mejora de 12,7 puntos.

Ejecute el mismo brazo dos veces sin cambiar nada y la exactitud de las respuestas salió 71,2 % y luego 76,0 %. Medido de nuevo con tres réplicas por caso, aproximadamente uno de cada nueve casos observados cambió de veredicto entre mediciones idénticas: 6 de 54 en exactitud, 7 de 57 en la página mejor clasificada.

La razón no es que la medición esté rota. Es que una diferencia sobre 58 casos, algunos de los cuales no pudieron medirse en absoluto, queda holgadamente dentro del ruido que la muestra puede producir por sí sola. El intervalo, y no la estimación puntual, le dice si ha aprendido algo.

Qué reportar

Tres números, en este orden: la diferencia, su intervalo y el número de casos que la respaldan. Con menos, un lector no puede juzgar la afirmación. Esta es esa ejecución, reranker activado frente a reranker desactivado, emparejada caso por caso, en puntos:

Diferencias emparejadas, reranker activado menos reranker desactivado, en un panel de 58 casos
Casos emparejadosMétricaDiferenciaIntervalo del 95 %Se lee como
48Página correcta en la posición 1+6.2−36.3 … +45.5No concluyente
46Respuesta correcta+6.5−39.4 … +48.4No concluyente
27Página correcta entre las 3 primeras+3.7−73.9 … +76.2No concluyente

Todos los intervalos cruzan el cero, y con holgura. Las estimaciones puntuales dicen todas que el reranker ayuda; los intervalos dicen que este panel no puede saber si ayuda o perjudica. Eso es un hallazgo en sí mismo: el panel es demasiado pequeño, y pierde demasiados casos, para resolver la cuestión que se pretendía resolver con él.

Ausente no es cero

Cuatro de las 58 llamadas devolvieron HTTP 500 desde el sistema evaluado, y dos llamadas al juez no devolvieron ningún veredicto que pudiera analizarse. Un arnés que promedia un caso sin calificar como cero registra esos seis como fallos del asistente: seis fallos fabricados de 58. Oloproof los registra como ausentes y amplía el intervalo para acotar lo que pudieran haber sido.

Eso es lo que la tercera fila está teniendo en cuenta. Solo 27 de los 58 casos pudieron medirse con un corte de tres páginas clasificadas, y el intervalo da cuenta de los otros 31 en lugar de ocultarlos.

Los paneles pequeños superan los gates

La misma regla se cumple en el extremo pequeño. Una ejecución de humo de tres casos obtuvo 1,000, con un intervalo del 95 % de 0,292 a 1,000. Un gate que compara la estimación puntual con un objetivo lo publica. Un gate que lee el intervalo dice lo que es cierto: tres casos no pueden distinguir un sistema perfecto de uno que acierta tres veces de cada diez.

Estrechar el intervalo

Más casos estrechan un intervalo, y también perder menos. En el mismo panel, declarar transitorios los HTTP 500 del sistema, para que el runner los reintentara, recuperó 18 de 22 casos ausentes y estrechó el intervalo un 39 %, minutos después, sin ningún otro cambio.

Una diferencia cuyo intervalo supera el umbral respalda una decisión, sea cual sea su tamaño, y es sobre ella sobre la que debe actuar un gate. Hasta entonces, reporte la diferencia, su intervalo y los casos que la respaldan, y diga que la respuesta aún no está.

¿Quiere que esto se calcule por usted en cada cambio?

Contáctenos