변경 내역
새로 출시된 것과, 그것이 릴리스 결정에 무엇을 바꾸는지.
Oloproof가 PyPI에 올라왔습니다
oloproof 0.1.0a1이 게시되었습니다. 이제 골든 패스는 깨끗한 환경에서 pip install oloproof로 시작해 곧바로 oloproof init와 oloproof run으로 이어집니다. 릴리스는 태그가 붙은 커밋에서 CI가 빌드하고, PyPI의 신뢰할 수 있는 게시(trusted publishing)를 통해 저장된 토큰 없이 게시합니다.
실행이 어떻게 결정에 도달했는지 다시 재생하기
조기에 멈추는 실행이나 비교는 이제 자신이 살펴본 모든 시점을 기록하고, 워크벤치가 이를 다시 재생합니다. 움직이지 않는 임계값을 기준으로 시점마다 좁아지는 anytime-valid 구간과, 모든 규칙이 결정을 내린 시점을 보여 줍니다. 엔진이 기록한 구간만 그립니다. 고정 표본 구간은 실시간인 것처럼 애니메이션으로 보여 주지 않습니다. 좋아 보일 때까지 지켜보는 것만으로 그 보장이 무효가 되기 때문입니다.
명령 팔레트, 키보드 탐색, 그리고 근거 사슬
⌘K 또는 Ctrl+K는 볼 수 있는 모든 목적지를 나열하고, 실행 ID나 비교 다이제스트를 붙여 넣으면 바로 엽니다. g 다음에 글자 하나를 누르면 이동하고, j와 k로 표의 행 사이를 움직이며, ?는 모든 단축키를 보여 줍니다. 케이스는 해당 실행 옆에서 열리며, 근거 사슬과 라벨을 단 사람들이 함께 표시됩니다. 동작 줄이기 설정에서는 모든 애니메이션이 멈춥니다.
oloproof.com의 호스팅 워크벤치
이제 워크벤치가 oloproof.com에서 제공되며, 엔드투엔드 골든 패스가 호스트에서 통과했습니다. 리뷰어가 워크스페이스가 추출한 80개 케이스에 라벨을 달아 심사가 통과시킨 오답 7개를 찾아냈고, 푸시된 실행만으로는 근거가 불충분했던 곳에서 워크스페이스는 검증된 표본으로 통과로 결정했습니다(91.2%, 구간 74.5%~100.0%). 초대를 통해서만 이용할 수 있습니다.
OpenTelemetry 트레이스를 oloproof collect로
oloproof collect는 표준 OpenTelemetry SDK로부터 OTLP/HTTP를 받아 GenAI 및 OpenInference 스팬을 콘텐츠 주소 기반 트레이스로 조립하고, 그 내용을 여러분의 머신에 보관합니다. 푸시는 여러분의 이그레스 정책을 따릅니다. oloproof traces promote는 트레이스를 출처 정보와 함께 테스트 케이스로 바꾸며, 중복은 거부합니다.
프로덕션 트래픽 표본에 대한 결정
여러분의 컬렉터는 매시간 봉인한 모든 트레이스에 대한 커밋먼트에 서명합니다. 그러면 워크스페이스가 자체 난수로 표본을 추출하고 추출된 각 트레이스를 커밋먼트와 대조하므로, 트레이스를 빼돌리는 방식으로 표본을 골라낼 수 없습니다. oloproof traces evaluate가 기록된 출력으로 표본을 심사하고, 워크스페이스가 Owner가 고정한 평가에 따라 결정하며, 신뢰 시퀀스가 프로젝트의 Production 페이지에서 표본에 걸쳐 각 지표를 추적합니다.
브라우저의 리뷰 대기열
Owner나 Admin이 대기열을 열고 리뷰어를 배정하면, 리뷰어는 키보드로 라벨을 답니다. 통과 또는 실패, 선언된 척도의 점수, 또는 두 실행 사이의 블라인드 선호이며, 각각 계정별로 기록됩니다. 리뷰어의 브라우저는 5분짜리 서명된 티켓으로 여러분 쪽의 oloproof collect에서 케이스 내용을 가져오므로, 워크스페이스는 그 내용을 결코 보관하지 않습니다.
검증된 실행
실행은 Owner가 등록한 러너 키나 관리형 워커로 서명할 수 있습니다. Owner는 평가 전체(스위트, 평가기, 지표, 기준 실행)와 그 게이트 정책을 고정하고, 워크스페이스는 각 시스템 버전을 정확히 그 평가의 첫 실행에서 고정된 실행과 비교해 결정합니다. 사람의 라벨은 독립적인 라벨러의 것만 계정별로 집계됩니다.
워크스페이스가 추출하는 사람 표본
PPI 구간은 사람 라벨의 무작위 표본으로 심사를 보정하며, 그 보장에는 아무도 고르지 않은 표본이 필요합니다. 이제 워크스페이스는 실행의 근거가 그곳에 고정된 뒤에 표본을 추출하고, 시드를 외부에 알리지 않으며, 보정된 구간을 자체 엔진으로 확인합니다. 실행 페이지는 워크스페이스가 구간을 검증했는지 알려 주며, 여러분의 머신에서 추출한 표본은 선의에 의한 것으로 표시된 채 남습니다.
조기 중단, 그리고 사람이 보정하는 심사 비율
early_stopping: true가 설정된 정책은 시드가 지정된 배치로 케이스를 실행하고, 모든 규칙이 결정을 내리면 실행을, 또는 후보와 기준을 나란히 멈춥니다. 이는 필요하지 않았던 케이스와 함께 DECIDED_EARLY로 기록됩니다. 멈춘 비율에는 anytime-valid 베팅 구간을 쓰므로, 배치마다 살펴보아도 보장이 유지됩니다. 심사의 통과율은 심사와 사람 라벨의 블라인드 무작위 표본을 결합한 PPI 구간으로 게이트할 수 있으며, 심사만의 구간과 사람만의 구간 옆에 함께 표시됩니다.
이메일 알림
네 가지 알림이 있으며, 각각 멤버가 이메일 자체에서 끌 수 있는 범주입니다. 관리형 작업의 완료 또는 실패, 게이트가 릴리스를 막은 푸시된 실행이나 비교, 무료 사용량의 80%와 100% 도달, 그리고 멤버 합류입니다. 게이트 이메일은 저장된 결정을 인용하고 실행으로 연결하며, 케이스 내용은 담지 않습니다. 이메일만 지원합니다. Slack, 호출기, 웹훅은 없습니다.
비밀번호, 그리고 계정 삭제
공급자뿐 아니라 이메일 주소와 비밀번호로도 로그인할 수 있으며, 주소 인증과 재설정을 지원합니다. 사람은 자신의 계정을 삭제할 수 있습니다. 사용자와 그 사람만 속해 있던 모든 워크스페이스가 한 번에 삭제되고, 워커가 그 워크스페이스들의 근거를 제거합니다.
확률 심사, 보정, 그리고 캐스케이드
심사는 유형이 정해진 질문(예 또는 아니요, 선택지, 수준에 따른 점수)에 모든 답의 확률로 답할 수 있으며, 이는 로컬 모델의 토큰 확률에서 한 번의 순전파로 읽어 냅니다. 그 보정은 사람 라벨과 비교해 측정되어 레지스트리 항목에 기록되고, 캐스케이드는 저렴한 심사가 확신하지 못하는 케이스만 더 강한 심사로 보냅니다. 학습된 분류기도 키 없이, 네트워크 없이 평가기가 될 수 있습니다.
사람 라벨에 맞춰 검증되는 심사
실행의 케이스에 파일이나 터미널로 라벨을 달고, 초안 심사를 채택하기 전에 그 라벨로 시험해 보십시오. 심사는 일치도 옆에 편향을 보고하고, 편향이 선언된 허용 폭을 넘는 심사는 게이트에 쓰일 수 없으며, 측정 대상 모델이 바뀌면 검증은 더 이상 인정되지 않습니다. 라벨이 필요 없는 프로브는 중요한 것이 바뀌지 않았는데도 판정이 움직이는지 확인하고, 쌍대 비교는 양쪽 순서로 모두 묻기 때문에, 위치 때문에만 선호된 답은 누구의 라벨 없이도 드러납니다.
멀티 에이전트 근거
트래젝터리는 각 단계를 어느 에이전트가 수행했는지와 모든 핸드오프를 기록합니다. 평가기는 라우팅(요청이 처리해야 할 에이전트에 도달했는가), 도구 권한(어떤 에이전트가 자기 것이 아닌 도구를 호출했는가), 그리고 일을 끝내지 않고 제어를 주고받기만 하는 에이전트를 심사하며, 슬라이스는 경로별로 케이스를 묶습니다.
반복 측정과 불안정 케이스 수
스위트는 각 케이스를 여러 번 측정할 수 있습니다. 반복 측정은 어떤 구간보다도 먼저 케이스별로 집계되고, 비교는 이를 비율로 짝지으며, 실행은 스스로와 결과가 엇갈린 케이스가 몇 개인지 보고합니다. 시스템은 실패를 일시적인 것으로 표시해 러너가 재시도하게 할 수 있습니다. 실제 RAG 시스템에서 이렇게 해서 누락된 케이스 22개 중 18개를 되찾고 구간을 39% 좁혔습니다.