가이드
시작하기
Oloproof가 하는 일, 언제 사용하고 언제 사용하지 말아야 하는지, 그리고 이 가이드를 읽는 순서를 안내합니다. 하나의 애플리케이션에 대한 첫 평가부터 버전 비교, 리뷰, CI, 정확한 계약까지 다룹니다.
Oloproof가 하는 일
Oloproof는 고정된 케이스 집합에 대해 여러분의 AI 애플리케이션을 실행하고, 여러분이 고른 평가기로 각 출력을 확인하며, 그 결과를 구간이 있는 비율로 바꿉니다. 그런 다음 여러분이 작성한 릴리스 정책이 각 규칙을 PASS, FAIL, INSUFFICIENT_EVIDENCE 또는 MANUAL_REVIEW로 결정하고, 명령은 그 결정에 따라 종료되므로 CI가 이를 사용할 수 있습니다. 모든 것은 여러분의 머신에서 실행되며, 실행을 호스팅된 워크스페이스에 push하지 않는 한 아무것도 머신 밖으로 나가지 않습니다. 용어는 핵심 개념에 정의되어 있습니다.
여러분이 신뢰하는 케이스에서 애플리케이션이 명시된 기준을 충족하는지, 그 답이 얼마나 확실한지, 그리고 변경이 더 좋게 했는지 나쁘게 했는지 알아야 할 때 사용하십시오. Oloproof는 여러분의 시스템을 호출합니다. 시스템을 호스팅하거나 샌드박스에 넣거나 초기화하지 않으며, 상태, 세션, 도구의 부수 효과는 여러분의 애플리케이션이 직접 관리합니다. 시스템 종류별로 무엇이 구현되어 있고 무엇이 아닌지는, 도입을 결정하기 전에 지금 동작하는 것을 읽으십시오.
이 가이드는 Oloproof 0.1.0a5를 설명합니다. pip show oloproof는 설치된 버전을 출력합니다. 더 오래된 버전에는 oloproof init --example처럼 여기에 나오는 명령이나 플래그가 없을 수 있으며, pip install --upgrade --pre oloproof로 최신 상태로 만들 수 있습니다.
여정
| 단계 | 할 일 | 읽을 것 |
|---|---|---|
| 1 | Oloproof가 하는 일과 사용 시점 알아보기 | 이 페이지, 핵심 개념, 지금 동작하는 것 |
| 2 | 기준선 없이 첫 애플리케이션 평가하기 | 빠른 시작 |
| 3 | 시스템 유형에 맞는 가이드 고르기 | 아래 표 |
| 4 | 실패를 살펴보고 결과 이해하기 | 스위트, 오류, 군집 케이스, 슬라이스 |
| 5 | 시스템을 바꾸고 버전 비교하기 | 비교, 비교 규칙 |
| 6 | 사람 리뷰, 협업, CI 추가하기 | 심사 모델, CI 게이트, CI에서 실행하기, 알림 |
| 7 | 정확한 기술 계약 찾아보기 | 구성, SDK 레퍼런스, 결과, CLI |
첫 평가에는 기준선이 필요 없습니다. 애플리케이션의 한 버전이 여러분의 요구 사항을 충족하는지 묻는 것이기 때문입니다. 두 버전의 비교는 비교 대상으로 삼을 만한 실행이 생긴 뒤인 5단계에서 다룹니다.
시스템 유형 고르기
| 여러분의 시스템 | 시작할 곳 |
|---|---|
| 분류기, 라우터 또는 구조화된 출력(레이블, JSON 객체) | 분류 |
| 자유 텍스트: 답변, 요약, 추출 | 텍스트 생성 |
| 어떤 언어로든 HTTP로 접근하는 서비스 | HTTP 엔드포인트 |
| 검색 증강 생성 | RAG |
| 도구를 사용하는 에이전트 또는 여러 에이전트 | 에이전트 |
| 학습된 예측 모델(분류 또는 회귀) | 예측 모델 |
| 멀티턴 대화 | 대화 |
이미지, 오디오, 비디오는 기본 지원되지 않습니다. 케이스가 URL이나 인코딩된 파일을 여러분의 시스템에 전달할 수 있고 사용자 정의 평가기가 출력을 확인할 수 있지만, 심사 모델은 JSON 텍스트만 봅니다.