Skip to content
← Todos os textos

Suas pontuações de avaliação mentem sobre o tamanho da amostra

Uma única média é a forma mais comum de as equipes se enganarem sobre uma mudança em IA. Veja o que reportamos no lugar dela, e por que o intervalo deve vir antes do número.

Pegue um painel dourado de 58 casos e um assistente de documentação real que responde a partir de um índice de busca real, e compare-o com o reranker ligado e desligado. Lendo as estimativas pontuais, o reranker eleva a parcela de respostas cuja página mais bem ranqueada é a certa de 61,8% para 74,5%. Isso parece progresso, e em um relatório de status costuma ser apresentado como um ganho de 12,7 pontos.

Execute o mesmo braço duas vezes sem mudar nada e a correção das respostas veio 71,2% e depois 76,0%. Medido de novo com três réplicas por caso, cerca de um em cada nove casos observados mudou de veredito entre medições idênticas: 6 de 54 em correção, 7 de 57 na página mais bem ranqueada.

O motivo não é que a medição esteja quebrada. É que uma diferença em 58 casos, alguns dos quais nem puderam ser medidos, está bem dentro do ruído que a amostra consegue produzir sozinha. O intervalo, e não a estimativa pontual, diz se você aprendeu alguma coisa.

O que reportar

Três números, nesta ordem: a diferença, seu intervalo e o número de casos por trás dela. Com menos que isso, o leitor não consegue julgar a afirmação. Aqui está essa execução, reranker ligado contra reranker desligado, pareada caso a caso, em pontos:

Diferenças pareadas, reranker ligado menos reranker desligado, em um painel de 58 casos
Casos pareadosMétricaDiferençaIntervalo de 95%Leitura
48Página certa na posição 1+6.2−36.3 … +45.5Inconclusivo
46Resposta correta+6.5−39.4 … +48.4Inconclusivo
27Página certa entre as 3 primeiras+3.7−73.9 … +76.2Inconclusivo

Todos os intervalos cruzam o zero, e com folga. As estimativas pontuais dizem todas que o reranker ajuda; os intervalos dizem que este painel não consegue dizer se ele ajuda ou atrapalha. Isso já é uma constatação: o painel é pequeno demais, e perde casos demais, para resolver a questão que se pretendia resolver com ele.

Ausente não é zero

Quatro das 58 chamadas retornaram HTTP 500 do sistema em teste, e duas chamadas ao juiz não retornaram nenhum veredito que pudesse ser interpretado. Um harness que calcula a média de um caso sem nota como zero registra esses seis como falhas do assistente: seis falhas fabricadas em 58. O Oloproof os registra como ausentes e amplia o intervalo para cobrir o que quer que eles pudessem ter sido.

É isso que a terceira linha está precificando. Só 27 dos 58 casos puderam ser medidos com um corte de três páginas ranqueadas, e o intervalo leva em conta os outros 31 em vez de escondê-los.

Painéis pequenos passam em gates

A mesma regra vale na ponta pequena. Uma execução de fumaça com três casos obteve 1,000, com um intervalo de 95% de 0,292 a 1,000. Um gate que compara a estimativa pontual com uma meta a libera. Um gate que lê o intervalo diz o que é verdade: três casos não conseguem distinguir um sistema perfeito de um que acerta três vezes em dez.

Estreitando o intervalo

Mais casos estreitam um intervalo, e perder menos deles também. No mesmo painel, declarar transitórios os HTTP 500 do sistema, para que o runner tentasse de novo, recuperou 18 de 22 casos ausentes e estreitou o intervalo em 39%, minutos depois, sem nenhuma outra mudança.

Uma diferença cujo intervalo ultrapassa o limiar sustenta uma decisão, seja qual for o seu tamanho, e é sobre ela que um gate deve agir. Até lá, reporte a diferença, seu intervalo e os casos por trás dela, e diga que a resposta ainda não chegou.

Quer isso calculado para você a cada mudança?

Fale conosco