Skip to content
← 모든 글

여러분의 평가 점수는 표본 크기를 속이고 있습니다

단일 평균은 팀이 AI 변경에 대해 스스로를 속이는 가장 흔한 방법입니다. 그 대신 무엇을 보고하는지, 그리고 왜 구간이 숫자 앞에 와야 하는지 설명합니다.

58개 케이스로 된 골든 패널과, 실제 검색 인덱스를 바탕으로 답하는 운영 중인 문서 도우미를 놓고, 리랭커를 켠 경우와 끈 경우를 비교해 보십시오. 점추정치로 읽으면 리랭커는 1순위 페이지가 정답인 답변의 비율을 61.8%에서 74.5%로 끌어올립니다. 진전처럼 읽히고, 현황 보고에서는 보통 12.7포인트 향상으로 보고됩니다.

아무것도 바꾸지 않고 같은 조건을 두 번 실행했더니 답변 정확도가 71.2%, 그다음엔 76.0%로 나왔습니다. 케이스당 세 번씩 반복해 다시 측정하자, 관찰된 케이스 아홉 개 중 약 하나가 동일한 측정 사이에서 판정이 바뀌었습니다. 정확도에서는 54개 중 6개, 1순위 페이지에서는 57개 중 7개였습니다.

측정이 고장 났기 때문이 아닙니다. 일부는 아예 측정할 수도 없었던 58개 케이스에서의 차이는, 표본이 스스로 만들어 낼 수 있는 잡음 안에 충분히 들어가기 때문입니다. 무언가를 알게 되었는지 알려 주는 것은 점추정치가 아니라 구간입니다.

무엇을 보고할 것인가

세 개의 숫자를 이 순서로 보고하십시오. 차이, 그 구간, 그리고 그 뒤에 있는 케이스 수입니다. 이보다 적으면 독자는 주장을 판단할 수 없습니다. 다음은 그 실행으로, 리랭커를 켠 경우 대 끈 경우를 케이스별로 짝지어 포인트 단위로 나타낸 것입니다.

쌍대 차이, 리랭커 켬 빼기 리랭커 끔, 58개 케이스 패널
짝지은 케이스지표차이95% 구간해석
481순위에 정답 페이지+6.2−36.3 … +45.5결론 없음
46정답+6.5−39.4 … +48.4결론 없음
27상위 3개 안에 정답 페이지+3.7−73.9 … +76.2결론 없음

모든 구간이 영을 크게 가로지릅니다. 점추정치는 모두 리랭커가 도움이 된다고 말하지만, 구간은 이 패널로는 도움이 되는지 해가 되는지 알 수 없다고 말합니다. 그 자체로 하나의 발견입니다. 이 패널은 너무 작고 손실이 너무 많아서, 결론을 내리려던 질문에 결론을 내릴 수 없습니다.

누락은 영이 아니다

58건의 호출 중 네 건은 테스트 대상 시스템에서 HTTP 500을 반환했고, 심사 호출 두 건은 해석할 수 있는 판정을 반환하지 않았습니다. 채점되지 않은 케이스를 영으로 평균 내는 하니스는 그 여섯 건을 도우미의 실패로 기록합니다. 58건 중 여섯 건의 만들어진 실패입니다. Oloproof는 이를 누락으로 기록하고, 그 값이 무엇이었든 감쌀 수 있도록 구간을 넓힙니다.

세 번째 행이 반영하는 것이 바로 이것입니다. 순위 페이지 세 개를 기준으로 측정할 수 있었던 케이스는 58개 중 27개뿐이며, 구간은 나머지 31개를 숨기는 대신 반영합니다.

작은 패널은 게이트를 통과한다

작은 쪽에서도 같은 규칙이 적용됩니다. 케이스 세 개로 된 스모크 실행은 1.000점을 받았고, 95% 구간은 0.292에서 1.000이었습니다. 점추정치를 목표와 비교하는 게이트라면 이를 출시합니다. 구간을 읽는 게이트는 사실을 말합니다. 케이스 세 개로는 완벽한 시스템과 열 번 중 세 번만 맞는 시스템을 구별할 수 없습니다.

구간 좁히기

케이스가 많을수록 구간은 좁아지고, 케이스를 덜 잃어도 좁아집니다. 같은 패널에서 시스템의 HTTP 500을 일시적인 것으로 선언해 러너가 재시도하게 했더니, 다른 것은 아무것도 바꾸지 않고 몇 분 만에 누락된 케이스 22개 중 18개를 되찾고 구간을 39% 좁혔습니다.

구간이 임계값을 넘어선 차이는 크기와 관계없이 결정을 뒷받침하며, 게이트가 따라야 할 것은 바로 그것입니다. 그때까지는 차이, 그 구간, 그 뒤에 있는 케이스를 보고하고, 아직 답이 나오지 않았다고 말하십시오.

모든 변경마다 이것을 계산해 받고 싶으신가요?

문의하기