Przejdź do treści

Przewodniki

Zacznij tutaj

Co robi Oloproof, kiedy go używać, a kiedy nie, oraz w jakiej kolejności czytać te przewodniki: od pierwszej ewaluacji jednej aplikacji, przez porównywanie wersji, przegląd i CI, po dokładne kontrakty.

Co robi Oloproof

Oloproof uruchamia Twoją aplikację AI na stałym zbiorze przypadków, sprawdza każdy wynik wybranymi przez Ciebie ewaluatorami i zamienia rezultaty w odsetki z przedziałami. Napisana przez Ciebie polityka wydań rozstrzyga następnie każdą regułę jako PASS, FAIL, INSUFFICIENT_EVIDENCE lub MANUAL_REVIEW, a polecenie kończy działanie zgodnie z tą decyzją, więc CI może z niej korzystać. Wszystko działa na Twojej maszynie; nic jej nie opuszcza, dopóki nie wypchniesz przebiegu do hostowanego obszaru roboczego. Terminy są zdefiniowane w Podstawowych pojęciach.

Używaj go, gdy musisz wiedzieć, czy aplikacja spełnia określoną poprzeczkę na przypadkach, którym ufasz, na ile pewna jest ta odpowiedź i czy zmiana coś poprawiła, czy pogorszyła. Oloproof wywołuje Twój system; nie hostuje go, nie izoluje w piaskownicy ani nie resetuje, a Twoja aplikacja sama zarządza swoim stanem, sesjami i skutkami ubocznymi narzędzi. Co jest zbudowane, a co nie, według rodzaju systemu, przeczytasz w Co działa dziś, zanim się zdecydujesz.

Te przewodniki opisują Oloproof 0.1.0a5. pip show oloproof wypisuje zainstalowaną wersję; starszej może brakować polecenia lub flagi pokazanej tutaj, na przykład oloproof init --example, a pip install --upgrade --pre oloproof ją aktualizuje.

Ścieżka

KrokCo robiszPrzeczytaj
1Poznajesz, co robi Oloproof i kiedy go używaćTa strona, Podstawowe pojęcia, Co działa dziś
2Ewaluujesz swoją pierwszą aplikację, bez punktu odniesieniaSzybki start
3Wybierasz przewodnik dla swojego rodzaju systemuTabela poniżej
4Przeglądasz niepowodzenia i rozumiesz wynikZestawy, Błędy, Przypadki klastrowane, Wycinki
5Zmieniasz system i porównujesz wersjePorównanie, Reguły porównań
6Dodajesz przegląd przez ludzi, współpracę i CISędziowie, Bramkowanie, CI, Powiadomienia
7Sprawdzasz dokładne kontrakty techniczneKonfiguracja, Dokumentacja SDK, Wyniki, CLI

Pierwsza ewaluacja nie potrzebuje punktu odniesienia: pyta, czy jedna wersja Twojej aplikacji spełnia Twoje wymagania. Porównywanie dwóch wersji przychodzi w kroku 5, gdy masz już przebieg, z którym warto porównywać.

Wybierz rodzaj systemu

Twój systemZacznij od
Klasyfikator, router lub wynik ustrukturyzowany (etykieta, obiekt JSON)Klasyfikacja
Swobodny tekst: odpowiedzi, streszczenia, ekstrakcjaGenerowanie tekstu
Usługa dostępna przez HTTP, w dowolnym językuPunkt końcowy HTTP
Generowanie wspomagane wyszukiwaniemRAG
Agent korzystający z narzędzi lub kilku agentówAgenci
Wytrenowany model predykcyjny (klasyfikacja lub regresja)Modele predykcyjne
Rozmowa wieloturowaRozmowy

Obrazy, dźwięk i wideo nie mają natywnego wsparcia: przypadek może przekazać przez Twój system URL lub zakodowany plik, a własny ewaluator może sprawdzić wynik, ale sędziowie widzą wyłącznie tekst JSON.