Przewodniki
Co działa dzisiaj
Co możesz dziś ewaluować za pomocą Oloproof, jak do tego dotrzesz (Python SDK, oloproof.yaml i CLI albo przeglądarka) oraz czego nie zbudowano. Strona opiera się na audycie możliwości z 8 października 2026, wewnętrznym przeglądzie, który sprawdził każdy wiersz względem kodu i jego testów, a nie względem planów.
Jak czytać tę stronę
"SDK" oznacza pakiet Pythona (import oloproof). "YAML" oznacza projekt uruchamiany przez oloproof run z oloproof.yaml. To nie ta sama powierzchnia: kilka ewaluatorów istnieje tylko w jednej z nich, a ta strona mówi, w której. "Przeglądarka" oznacza hostowany workbench, który pokazuje to, co wyślesz przez oloproof push; nie uruchamia ewaluacji, których nie zdefiniowano w kodzie lub YAML.
Oloproof wywołuje Twój system; nie hostuje go, nie izoluje ani nie resetuje. Twoja aplikacja zarządza własnym stanem, sesjami i skutkami ubocznymi narzędzi podczas uruchomienia.
Według rodzaju systemu
| Twój system | Co działa | Gdzie | Nie zbudowano |
|---|---|---|---|
| Klasyfikator lub wynik strukturalny | Dokładne dopasowanie, zawieranie, regex, schemat JSON, sędzia z rubryką, sędzia probabilistyczny, klasyfikator modelowy; odsetki zaliczeń z przedziałami | SDK i YAML; model_classifier, probability_judge i cascade tylko w YAML | n/a |
| Generowanie tekstu, streszczenia, ekstrakcja | Te same kontrole na swobodnym tekście, sędziowie z rubryką, zgodność sędziego z etykietami ludzi, preferencja parami | SDK i YAML; preferencja to polecenie oloproof prefer | BLEU, ROUGE lub podobieństwo embeddingów (napisz własne z @evaluator) |
| RAG uruchamiany jako czarna skrzynka | Hit rate, recall, MRR, nDCG, poprawność cytowań, sędziowie ugruntowania i wsparcia cytowań, z artefaktów wyszukiwania, które Twój system rejestruje lub zwraca | SDK i YAML | Diagnoza: diagnose wymaga systemu etapowego |
| RAG zbudowany etapami | Wszystko powyższe, pamięć podręczna per etap oraz oloproof diagnose ze złotym kontekstem, zmianami top-k lub rerankera obok kontroli | SDK @rag_system, YAML system.rag, CLI diagnose | Interwencje poza tymi trzema |
| Agent używający narzędzi | Limity kroków, wymagane i zabronione narzędzia, kolejność narzędzi, pętle, ograniczenia, z zarejestrowanej trajektorii | SDK i YAML | Kontrola jakości trajektorii oceniana przez LLM |
| System wieloagentowy | Routing, uprawnienia narzędzi per agent, limity przekazań | SDK i YAML | n/a |
| Odtwarzanie agenta | Ponowne uruchomienie przypadku od punktu kontrolnego, by oznaczyć krok jako potrzebny lub nie | Tylko SDK (replay_case), dla systemu obsługującego punkty kontrolne | Polecenie CLI |
| Model klasyfikacji binarnej | Accuracy, precision, recall, Brier, log loss, ranking (AUC) | SDK i YAML predictive: | n/a |
| Model wieloklasowy | Jeden blok na klasę (jedna przeciw reszcie) | SDK i YAML | Średnie makro lub mikro |
| Model regresji | Błąd bezwzględny w zadeklarowanym target_range | SDK i YAML | Błąd kwadratowy, R kwadrat, błąd nieograniczony |
| Rozmowa wieloturowa | Czy każda zaplanowana tura otrzymała odpowiedź oraz sędzia z rubryką dla całej rozmowy | Tylko SDK (ConversationCompleted, ConversationJudge) | Typy YAML, wyniki per tura, symulator użytkownika, odtwarzanie rozmowy |
| Obrazy, dźwięk, wideo | Nic natywnego: przypadek może przenieść URL lub zakodowany plik przez Twój system, a @evaluator może sprawdzić wynik | n/a | Sędziowie widzą tylko tekst JSON; brak artefaktów multimedialnych i renderowania |
Obejście dla rozmów wieloturowych: każda tura staje się przypadkiem, a tury jednej rozmowy dostają ten sam group_id, więc analiza traktuje je jako klaster (Klastry). Każda tura jest wtedy osobnym wywołaniem, a nie jednym zarejestrowanym dialogiem.
Podłączanie systemu
- Funkcja Pythona: @system w SDK lub system.callable: module:function w YAML. Otrzymuje input przypadku i zwraca słownik. Działają funkcje synchroniczne i asynchroniczne.
- HTTP: system.http z url, method, output_path, artifacts i timeout_s. Wejście przypadku jest wysyłane jako ciało JSON, a odpowiedź odczytywana jako JSON. Nagłówków i uwierzytelniania nie można jeszcze skonfigurować; punkt końcowy wymagający klucza umieść za funkcją, która go dodaje.
- Niestandardowe ewaluatory: @evaluator w SDK. oloproof.yaml nie może go jeszcze wskazać.
Przepływy pracy
| Przepływ pracy | Co działa | Nie zbudowano |
|---|---|---|
| Porównanie dwóch wersji | Sparowana wyższość, nie-gorszość i równoważność; wycinki z kontrolą wielokrotności | n/a |
| CI | Kody wyjścia oloproof gate z block_on Twojej polityki, zatwierdzenie, podpisane zapisy; podsumowanie pull requesta (--summary markdown) | n/a |
| Przegląd ludzki | Etykiety z pliku lub terminala; kolejka przeglądu w przeglądarce z przypisanymi recenzentami w hostowanym obszarze roboczym | Kolejka przeglądu w przeglądarce dla lokalnego projektu |
| Workbench w przeglądarce | Uruchomienia, przypadki, porównania, diagnostyka, ewaluatory, przegląd i ruch, po oloproof push | Import zbiorów danych, tworzenie sędziów, harmonogramy, alerty i analizy powdrożeniowe (pokazane jako planowane) |
| Lokalna przeglądarka | n/a | Żadne polecenie CLI nie udostępnia workbencha lokalnie; jest hostowany |
Co zostało przetestowane i jak
Każda rodzina powyżej ma testy automatyczne, uruchamiane na fixture'ach i zamockowanych dostawcach. Uruchomienia na prawdziwych systemach z prawdziwymi modelami są zarejestrowane dla RAG, pojedynczego agenta i rozmowy wieloturowej; dla modeli predykcyjnych i systemów wieloagentowych jeszcze ich nie ma. Metody statystyczne, które decydują o wydaniach, są każda przyjęte przez własny audyt; metryka bez przyjętego przedziału nie rozstrzyga reguły na podstawie przedziału, a reguła, która by go potrzebowała, zwraca MANUAL_REVIEW lub INSUFFICIENT_EVIDENCE z przyczyną.