Skip to content
← Tous les articles

Vos scores d’évaluation mentent sur la taille de l’échantillon

Une moyenne unique est la façon la plus courante dont les équipes se trompent elles-mêmes sur un changement d’IA. Voici ce que nous présentons à la place, et pourquoi l’intervalle doit passer avant le chiffre.

Prenez un panel de référence de 58 cas et un assistant de documentation réel qui répond à partir d’un véritable index de recherche, et comparez-le avec son reranker activé et désactivé. À lire les estimations ponctuelles, le reranker fait passer la part des réponses dont la page classée en tête est la bonne de 61,8 % à 74,5 %. Cela ressemble à un progrès, et dans un point d’avancement on le présente généralement comme un gain de 12,7 points.

Exécutez deux fois la même branche sans rien changer : l’exactitude des réponses est revenue à 71,2 %, puis à 76,0 %. Mesuré à nouveau avec trois réplicats par cas, environ un cas observé sur neuf a changé de verdict entre des mesures identiques : 6 sur 54 pour l’exactitude, 7 sur 57 pour la page classée en tête.

La raison n’est pas que la mesure soit défaillante. C’est qu’une différence sur 58 cas, dont certains n’ont pas pu être mesurés du tout, se situe largement dans le bruit que l’échantillon peut produire à lui seul. C’est l’intervalle, et non l’estimation ponctuelle, qui vous dit si vous avez appris quelque chose.

Ce qu’il faut présenter

Trois nombres, dans cet ordre : l’écart, son intervalle et le nombre de cas derrière lui. Avec moins, un lecteur ne peut pas juger l’affirmation. Voici cette exécution, reranker activé contre reranker désactivé, appariée cas par cas, en points :

Différences appariées, reranker activé moins reranker désactivé, sur un panel de 58 cas
Cas appariésMétriqueÉcartIntervalle à 95 %Lecture
48Bonne page au rang 1+6.2−36.3 … +45.5Non concluant
46Réponse correcte+6.5−39.4 … +48.4Non concluant
27Bonne page dans le top 3+3.7−73.9 … +76.2Non concluant

Chaque intervalle franchit zéro, et largement. Les estimations ponctuelles disent toutes que le reranker aide ; les intervalles disent que ce panel ne peut pas dire s’il aide ou s’il nuit. C’est un résultat en soi : le panel est trop petit, et comporte trop de pertes, pour trancher la question qu’on lui demandait de trancher.

Manquant ne veut pas dire zéro

Quatre des 58 appels ont renvoyé une erreur HTTP 500 du système testé, et deux appels au juge n’ont renvoyé aucun verdict exploitable. Un harnais qui compte un cas non noté comme zéro enregistre ces six cas comme des échecs de l’assistant : six échecs fabriqués sur 58. Oloproof les enregistre comme manquants et élargit l’intervalle pour borner ce qu’ils auraient pu être.

C’est ce que la troisième ligne fait payer. Seuls 27 des 58 cas ont pu être mesurés avec un seuil de trois pages classées, et l’intervalle tient compte des 31 autres au lieu de les cacher.

Les petits panels passent les portes

La même règle vaut à la petite échelle. Une exécution de vérification rapide sur trois cas a obtenu 1,000, avec un intervalle à 95 % allant de 0,292 à 1,000. Une porte qui compare l’estimation ponctuelle à un objectif la laisse passer. Une porte qui lit l’intervalle dit ce qui est vrai : trois cas ne permettent pas de distinguer un système parfait d’un système qui a raison trois fois sur dix.

Resserrer l’intervalle

Plus de cas resserrent un intervalle, et en perdre moins aussi. Sur le même panel, déclarer transitoires les erreurs HTTP 500 du système, pour que le runner les relance, a récupéré 18 des 22 cas manquants et resserré l’intervalle de 39 %, quelques minutes plus tard, sans rien changer d’autre.

Un écart dont l’intervalle franchit le seuil appuie une décision, quelle que soit sa taille, et c’est sur celui-là qu’une porte doit agir. D’ici là, présentez l’écart, son intervalle et les cas qui le fondent, et dites que la réponse n’est pas encore connue.

Vous voulez que cela soit calculé pour vous à chaque changement ?

Contactez-nous