Skip to content

RAG와 검색 팀을 위해

인덱스 변경이 무엇을 했는지 알아내세요.

검색 변경은 청킹 diff로는 보이지 않는 방식으로 품질을 움직입니다. Oloproof는 RAG 시스템을 자신이 볼 수 있는 두 단계로 실행하고, 변경 전후에 같은 케이스로 검색, 인용, 근거성, 답변 정확도를 측정합니다.

측정

검색을 이해하는 평가기

기록된 후보에서 읽어 낸, 선택한 컷오프에서의 적중률, 재현율, MRR, nDCG. 모델에 주어진 컨텍스트에 비춘 인용 유효성. 그 컨텍스트를 읽는 근거성 심사 모델과 인용 뒷받침 심사 모델. 리트리버가 반환한 것보다 깊은 컷오프는 누락으로 채점되지 않고 거부됩니다.

분리

한 번에 한 단계씩

각 단계는 따로 캐시되므로 프롬프트를 바꿔도 검색을 다시 하지 않습니다. 진단은 실패한 케이스를 정답 구절로 대조군과 나란히 다시 실행하고, 각각을 검색 누락, 순위 밖 밀림, 컨텍스트에서 누락, 생성 실패 중 하나로 분류합니다.

결정

구간으로 게이트하기

후보와 기준선은 선언한 마진에 대해 케이스별로 대응됩니다. 규칙은 그 구간이 마진을 넘을 때만 통과합니다. 판단하기에 너무 넓은 구간은 근거 불충분으로 릴리스를 막고, 근거는 결정 옆에 보관됩니다.

실제 결과

실제 운영 중인 RAG 문서 어시스턴트 · 리랭크 사용과 리랭크 미사용 비교 · 58문항 · 자체 실행, 2026년 9월 22일

1순위에 정답 페이지

+6.2%p

[−36.3, +45.5] · 48건 대응 · 미결

상위 3개 안에 정답 페이지

+3.7%p

[−73.9, +76.2] · 27건 대응 · 미결

정답

+6.5%p

[−39.4, +48.4] · 46건 대응 · 미결

점추정치로 읽으면 리랭커는 '1위가 올바른 페이지'를 12.7%p 높였고, 그대로 배포되었을 것입니다. 두 그룹이 모두 답한 질문에서 대응시키면 모든 구간이 영을 가로지릅니다. 이 패널로는 리랭커가 도움이 되는지 해가 되는지 말할 수 없으며, Oloproof는 승자를 고르는 대신 그렇게 말합니다. 현장 보고서 읽기.