현장 보고서 · 자체 실행
리랭커는 개선처럼 보였습니다. 근거로는 판단할 수 없었습니다.
저희가 운영하지 않는, 실제 운영 중인 검색 증강 문서 어시스턴트를 대상으로 Oloproof를 실행했습니다. 그 시스템 자체의 리트리버와 인덱스, 실제 생성, LLM 심사 모델, 그리고 소유자의 58문항 골든 패널을 그대로 사용했습니다. 고객은 관여하지 않았습니다. 이것은 저희의 실행이며, 감사한 그대로 보고합니다.
- 58
- 소유자 골든 패널의 질문 수
- 76건 중 0건
- 결론이 난 기능 플래그 비교
- 9건 중 1건꼴
- 동일한 실행 사이에 판정이 바뀐 케이스
- 23건 중 15건
- 정답 구절로 회복된 실패 답변
리랭크 사용과 리랭크 미사용 비교, 2026년 9월 22일
| 지표 | 리랭크 사용 | 리랭크 미사용 | 대응 차이 (사용 − 미사용) |
|---|---|---|---|
| 1순위에 정답 페이지 | 0.745 [0.519, 0.875] · 58건 중 51건 | 0.618 [0.449, 0.760] · 58건 중 55건 | +6.2%p [−36.3, +45.5] · 48건 대응 |
| 상위 3개 안에 정답 페이지 | 0.742 [0.270, 0.939] · 58건 중 31건 | 0.683 [0.350, 0.875] · 58건 중 41건 | +3.7%p [−73.9, +76.2] · 27건 대응 |
| 답변 정확 (LLM 심사 모델) | 0.760 [0.519, 0.888] · 58건 중 50건 | 0.685 [0.501, 0.819] · 58건 중 54건 | +6.5%p [−39.4, +48.4] · 46건 대응 |
이전
이 어시스턴트에는 이미 괜찮은 하니스가 있었습니다. 골든 패널, LLM 심사 모델, 릴리스 게이트입니다. 게이트는 패널 크기와 상관없이 점추정치를 목표치와 비교했습니다. 그렇게 읽으면 리랭커는 '1위가 올바른 페이지'를 12.7%p 높였고, 그대로 배포되었을 것입니다. 게다가 릴리스를 가르던 충실도 점수에서는 심사 모델이 채점하지 못한 답변이 완전한 실패로 계산되었습니다.
이후
Oloproof는 두 그룹이 모두 답한 질문에서 두 그룹을 대응시키고, 서버 오류 4건과 해석할 수 없는 판정 2건을 결측으로 기록했으며, 이를 감싸도록 각 구간을 넓혔습니다. 세 차이 모두 영을 크게 가로지릅니다. 이 패널로는 리랭커가 도움이 되는지 해가 되는지 말할 수 없습니다.
실패한 답변 23건을 검색된 구절 대신 정답 구절로 다시 실행하자 15건이 회복되었고, 그 옆에는 아무것도 바꾸지 않고 다시 실행한 대조군을 두었습니다. 진단은 5건을 검색 누락, 7건을 생성 실패로 분류하고 11건은 미해결로 남겼으며, 다음 실험으로 검색 깊이와 인덱스 구성을 지목했습니다.
세 번 반복해 측정하자, 아무것도 바꾸지 않았는데도 대략 아홉 케이스 중 하나꼴로 판정이 바뀌었고, 호출의 13.8%가 서버 오류를 반환했습니다. 이 오류를 일시적 오류로 선언하자 결측 케이스 22건 중 18건이 회복되었고 구간은 39% 좁아졌습니다. 이어서 어시스턴트의 기능 플래그 열아홉 개를 훑자 대응 비교 76건이 나왔지만 결론이 난 것은 하나도 없었고, 가장 유망한 세 개에 결론을 내리려면 약 40문항이 더 필요합니다.
“58개 케이스로 된 스위트에서 아홉 개 중 하나가 물을 때마다 다르게 답한다면, 소수점 넷째 자리까지의 해상도는 없습니다.”
한눈에 보기
- 실행 주체Oloproof, 자체 판단으로
- 평가 대상 시스템저희가 운영하지 않는 실제 운영 중인 RAG 문서 어시스턴트
- 패널58문항, 소유자의 것 그대로, 변경 없음
- 심사 모델LLM 심사 모델, 아직 사람의 레이블과 대조하지 않음
- 실행일2026년 9월 22일과 23일
- 후속 실행기능 플래그 19개, 대화 24건
보여 주지 않는 것
시스템 하나, 코퍼스 하나, 그리고 스스로의 질문에 답을 내기엔 너무 작은 패널입니다. 모든 답변 점수 뒤에 있는 심사 모델은 사람을 기준으로 검증되지 않았고, 진단도 그렇게 밝힙니다. 패널은 단일 턴입니다. 대화 24건으로 진행한 후속 실행에서는 단일 턴 패널로는 나올 수 없는 재현 가능한 실패 두 가지가 발견되었고, 그중에는 어시스턴트가 한 턴 전에 자신이 한 말을 부인하는 경우도 있었습니다. 이것은 벤치마크가 아니며, 고객도 아닙니다.