Przewodniki
Zacznij tutaj
Co robi Oloproof, kiedy go używać, a kiedy nie, oraz w jakiej kolejności czytać te przewodniki: od pierwszej ewaluacji jednej aplikacji, przez porównywanie wersji, przegląd i CI, po dokładne kontrakty.
Co robi Oloproof
Oloproof uruchamia Twoją aplikację AI na stałym zbiorze przypadków, sprawdza każdy wynik wybranymi przez Ciebie ewaluatorami i zamienia rezultaty w odsetki z przedziałami. Napisana przez Ciebie polityka wydań rozstrzyga następnie każdą regułę jako PASS, FAIL, INSUFFICIENT_EVIDENCE lub MANUAL_REVIEW, a polecenie kończy działanie zgodnie z tą decyzją, więc CI może z niej korzystać. Wszystko działa na Twojej maszynie; nic jej nie opuszcza, dopóki nie wypchniesz przebiegu do hostowanego obszaru roboczego. Terminy są zdefiniowane w Podstawowych pojęciach.
Używaj go, gdy musisz wiedzieć, czy aplikacja spełnia określoną poprzeczkę na przypadkach, którym ufasz, na ile pewna jest ta odpowiedź i czy zmiana coś poprawiła, czy pogorszyła. Oloproof wywołuje Twój system; nie hostuje go, nie izoluje w piaskownicy ani nie resetuje, a Twoja aplikacja sama zarządza swoim stanem, sesjami i skutkami ubocznymi narzędzi. Co jest zbudowane, a co nie, według rodzaju systemu, przeczytasz w Co działa dziś, zanim się zdecydujesz.
Te przewodniki opisują Oloproof 0.1.0a5. pip show oloproof wypisuje zainstalowaną wersję; starszej może brakować polecenia lub flagi pokazanej tutaj, na przykład oloproof init --example, a pip install --upgrade --pre oloproof ją aktualizuje.
Ścieżka
| Krok | Co robisz | Przeczytaj |
|---|---|---|
| 1 | Poznajesz, co robi Oloproof i kiedy go używać | Ta strona, Podstawowe pojęcia, Co działa dziś |
| 2 | Ewaluujesz swoją pierwszą aplikację, bez punktu odniesienia | Szybki start |
| 3 | Wybierasz przewodnik dla swojego rodzaju systemu | Tabela poniżej |
| 4 | Przeglądasz niepowodzenia i rozumiesz wynik | Zestawy, Błędy, Przypadki klastrowane, Wycinki |
| 5 | Zmieniasz system i porównujesz wersje | Porównanie, Reguły porównań |
| 6 | Dodajesz przegląd przez ludzi, współpracę i CI | Sędziowie, Bramkowanie, CI, Powiadomienia |
| 7 | Sprawdzasz dokładne kontrakty techniczne | Konfiguracja, Dokumentacja SDK, Wyniki, CLI |
Pierwsza ewaluacja nie potrzebuje punktu odniesienia: pyta, czy jedna wersja Twojej aplikacji spełnia Twoje wymagania. Porównywanie dwóch wersji przychodzi w kroku 5, gdy masz już przebieg, z którym warto porównywać.
Wybierz rodzaj systemu
| Twój system | Zacznij od |
|---|---|
| Klasyfikator, router lub wynik ustrukturyzowany (etykieta, obiekt JSON) | Klasyfikacja |
| Swobodny tekst: odpowiedzi, streszczenia, ekstrakcja | Generowanie tekstu |
| Usługa dostępna przez HTTP, w dowolnym języku | Punkt końcowy HTTP |
| Generowanie wspomagane wyszukiwaniem | RAG |
| Agent korzystający z narzędzi lub kilku agentów | Agenci |
| Wytrenowany model predykcyjny (klasyfikacja lub regresja) | Modele predykcyjne |
| Rozmowa wieloturowa | Rozmowy |
Obrazy, dźwięk i wideo nie mają natywnego wsparcia: przypadek może przekazać przez Twój system URL lub zakodowany plik, a własny ewaluator może sprawdzić wynik, ale sędziowie widzą wyłącznie tekst JSON.