소개
저희는 측정 계층을 만듭니다.
팀들은 매주 AI 시스템에 변경을 배포하지만, 직전 변경이 시스템을 더 낫게 만들었는지 말할 방법이 없습니다. Oloproof는 그 질문에 근거로 답하는 스택의 한 부분입니다. 추정값, 그 불확실성, 그리고 여러분이 확인할 수 있는 결정을 제공합니다.
결정하는 방식
추정값이 아니라 구간으로
규칙은 구간 전체가 임계값을 넘으면 통과하고, 구간 전체가 임계값에 못 미치면 실패합니다. 그 사이는 모두 근거 불충분으로 보고되며, 통과로 반올림되지 않습니다.
주장하는 것
재현할 수 없는 것은 아무것도 주장하지 않음
통계 방법은 작성된 노트, 커버리지 그리드, 감사를 갖춘 뒤에야 제품에 들어옵니다. 그 전까지 그 방법이 필요한 규칙은 방법을 빌려 쓰지 않고 안전하게 실패합니다.
근거가 있는 곳
기본적으로 여러분 곁에
로컬 실행은 여러분의 컴퓨터를 절대 떠나지 않습니다. 푸시는 지표, 구간, 결정을 담고, 프로젝트에서 달리 정하지 않는 한 원시 입력, 출력, 트레이스는 로컬에 둡니다.
심사
게이트하기 전에 측정됨
LLM 심사는 릴리스를 결정할 수 있기 전에 사람의 라벨과 대조해 검증되며, 일치도의 하한을 기준으로 봅니다.
언어 모델
근거 안이 아니라 그 위에
모델은 판정하고, 설명하고, 다음 실험을 제안할 수 있습니다. 통계 방법을 만들어 내거나 릴리스 결정을 내리지는 않습니다.
비용
같은 근거에 두 번 비용을 내지 않음
모든 실행과 판정은 그 내용에 따라 한 번만 저장됩니다. 변경되지 않은 스위트를 다시 실행하면 이미 있는 것을 재사용합니다.
무엇을 위한 것인가
작동하는가? 여러분이 선언한 시나리오와 기준에 대해, 분모를 밝혀서 답합니다.
어디서 실패하는가? 전체 비율이 가리는 슬라이스와 구성 요소까지 포함합니다.
얼마나 확신할 수 있는가? 결정을 이끄는 모든 숫자는 그 불확실성을 함께 지닙니다.
나중에 입증할 수 있는가? 결과 뒤에 있는 기록이 보관되므로 다른 사람이 확인할 수 있습니다.