Przejdź do treści

Przewodniki

Co działa dzisiaj

Co możesz dziś ewaluować za pomocą Oloproof, jak do tego dotrzesz (Python SDK, oloproof.yaml i CLI albo przeglądarka) oraz czego nie zbudowano. Strona opiera się na audycie możliwości z 8 października 2026, wewnętrznym przeglądzie, który sprawdził każdy wiersz względem kodu i jego testów, a nie względem planów.

Jak czytać tę stronę

"SDK" oznacza pakiet Pythona (import oloproof). "YAML" oznacza projekt uruchamiany przez oloproof run z oloproof.yaml. To nie ta sama powierzchnia: kilka ewaluatorów istnieje tylko w jednej z nich, a ta strona mówi, w której. "Przeglądarka" oznacza hostowany workbench, który pokazuje to, co wyślesz przez oloproof push; nie uruchamia ewaluacji, których nie zdefiniowano w kodzie lub YAML.

Oloproof wywołuje Twój system; nie hostuje go, nie izoluje ani nie resetuje. Twoja aplikacja zarządza własnym stanem, sesjami i skutkami ubocznymi narzędzi podczas uruchomienia.

Według rodzaju systemu

Twój systemCo działaGdzieNie zbudowano
Klasyfikator lub wynik strukturalnyDokładne dopasowanie, zawieranie, regex, schemat JSON, sędzia z rubryką, sędzia probabilistyczny, klasyfikator modelowy; odsetki zaliczeń z przedziałamiSDK i YAML; model_classifier, probability_judge i cascade tylko w YAMLn/a
Generowanie tekstu, streszczenia, ekstrakcjaTe same kontrole na swobodnym tekście, sędziowie z rubryką, zgodność sędziego z etykietami ludzi, preferencja paramiSDK i YAML; preferencja to polecenie oloproof preferBLEU, ROUGE lub podobieństwo embeddingów (napisz własne z @evaluator)
RAG uruchamiany jako czarna skrzynkaHit rate, recall, MRR, nDCG, poprawność cytowań, sędziowie ugruntowania i wsparcia cytowań, z artefaktów wyszukiwania, które Twój system rejestruje lub zwracaSDK i YAMLDiagnoza: diagnose wymaga systemu etapowego
RAG zbudowany etapamiWszystko powyższe, pamięć podręczna per etap oraz oloproof diagnose ze złotym kontekstem, zmianami top-k lub rerankera obok kontroliSDK @rag_system, YAML system.rag, CLI diagnoseInterwencje poza tymi trzema
Agent używający narzędziLimity kroków, wymagane i zabronione narzędzia, kolejność narzędzi, pętle, ograniczenia, z zarejestrowanej trajektoriiSDK i YAMLKontrola jakości trajektorii oceniana przez LLM
System wieloagentowyRouting, uprawnienia narzędzi per agent, limity przekazańSDK i YAMLn/a
Odtwarzanie agentaPonowne uruchomienie przypadku od punktu kontrolnego, by oznaczyć krok jako potrzebny lub nieTylko SDK (replay_case), dla systemu obsługującego punkty kontrolnePolecenie CLI
Model klasyfikacji binarnejAccuracy, precision, recall, Brier, log loss, ranking (AUC)SDK i YAML predictive:n/a
Model wieloklasowyJeden blok na klasę (jedna przeciw reszcie)SDK i YAMLŚrednie makro lub mikro
Model regresjiBłąd bezwzględny w zadeklarowanym target_rangeSDK i YAMLBłąd kwadratowy, R kwadrat, błąd nieograniczony
Rozmowa wieloturowaCzy każda zaplanowana tura otrzymała odpowiedź oraz sędzia z rubryką dla całej rozmowyTylko SDK (ConversationCompleted, ConversationJudge)Typy YAML, wyniki per tura, symulator użytkownika, odtwarzanie rozmowy
Obrazy, dźwięk, wideoNic natywnego: przypadek może przenieść URL lub zakodowany plik przez Twój system, a @evaluator może sprawdzić wynikn/aSędziowie widzą tylko tekst JSON; brak artefaktów multimedialnych i renderowania

Obejście dla rozmów wieloturowych: każda tura staje się przypadkiem, a tury jednej rozmowy dostają ten sam group_id, więc analiza traktuje je jako klaster (Klastry). Każda tura jest wtedy osobnym wywołaniem, a nie jednym zarejestrowanym dialogiem.

Podłączanie systemu

  • Funkcja Pythona: @system w SDK lub system.callable: module:function w YAML. Otrzymuje input przypadku i zwraca słownik. Działają funkcje synchroniczne i asynchroniczne.
  • HTTP: system.http z url, method, output_path, artifacts i timeout_s. Wejście przypadku jest wysyłane jako ciało JSON, a odpowiedź odczytywana jako JSON. Nagłówków i uwierzytelniania nie można jeszcze skonfigurować; punkt końcowy wymagający klucza umieść za funkcją, która go dodaje.
  • Niestandardowe ewaluatory: @evaluator w SDK. oloproof.yaml nie może go jeszcze wskazać.

Przepływy pracy

Przepływ pracyCo działaNie zbudowano
Porównanie dwóch wersjiSparowana wyższość, nie-gorszość i równoważność; wycinki z kontrolą wielokrotnościn/a
CIKody wyjścia oloproof gate z block_on Twojej polityki, zatwierdzenie, podpisane zapisy; podsumowanie pull requesta (--summary markdown)n/a
Przegląd ludzkiEtykiety z pliku lub terminala; kolejka przeglądu w przeglądarce z przypisanymi recenzentami w hostowanym obszarze roboczymKolejka przeglądu w przeglądarce dla lokalnego projektu
Workbench w przeglądarceUruchomienia, przypadki, porównania, diagnostyka, ewaluatory, przegląd i ruch, po oloproof pushImport zbiorów danych, tworzenie sędziów, harmonogramy, alerty i analizy powdrożeniowe (pokazane jako planowane)
Lokalna przeglądarkan/aŻadne polecenie CLI nie udostępnia workbencha lokalnie; jest hostowany

Co zostało przetestowane i jak

Każda rodzina powyżej ma testy automatyczne, uruchamiane na fixture'ach i zamockowanych dostawcach. Uruchomienia na prawdziwych systemach z prawdziwymi modelami są zarejestrowane dla RAG, pojedynczego agenta i rozmowy wieloturowej; dla modeli predykcyjnych i systemów wieloagentowych jeszcze ich nie ma. Metody statystyczne, które decydują o wydaniach, są każda przyjęte przez własny audyt; metryka bez przyjętego przedziału nie rozstrzyga reguły na podstawie przedziału, a reguła, która by go potrzebowała, zwraca MANUAL_REVIEW lub INSUFFICIENT_EVIDENCE z przyczyną.