Ga naar de inhoud

Handleidingen

Wat vandaag werkt

Wat je vandaag met Oloproof kunt evalueren, hoe je het bereikt (Python-SDK, oloproof.yaml en de CLI, of de browser), en wat niet gebouwd is. Het is gebaseerd op de capaciteitsaudit van 8 oktober 2026, een interne beoordeling die elke regel controleerde tegen de code en haar tests in plaats van tegen plannen.

Hoe je deze pagina leest

"SDK" betekent het Python-pakket (import oloproof). "YAML" betekent een project dat je draait met oloproof run vanuit oloproof.yaml. Het zijn niet dezelfde oppervlakken: een paar evaluators bestaan in maar één ervan, en deze pagina zegt welke. "Browser" betekent de gehoste werkbank, die toont wat je oloproof pusht; ze draait geen evaluaties die je niet in code of YAML hebt gedefinieerd.

Oloproof roept je systeem aan; het host, sandboxt of reset het niet. Je applicatie beheert haar eigen toestand, sessies en neveneffecten van tools tijdens een run.

Per soort systeem

Je systeemWat werktWaarNiet gebouwd
Classifier of gestructureerde uitvoerExacte overeenkomst, contains, regex, JSON-schema, rubric-judge, waarschijnlijkheidsjudge, modelclassifier; slagingspercentages met intervallenSDK en YAML; model_classifier, probability_judge en cascade alleen in YAMLn/a
Tekstgeneratie, samenvattingen, extractieDezelfde controles op vrije tekst, rubric-judges, overeenstemming van judges met menselijke labels, paarsgewijze voorkeurSDK en YAML; voorkeur is het commando oloproof preferBLEU, ROUGE of embedding-gelijkenis (schrijf er een met @evaluator)
RAG die je als black box draaitHit rate, recall, MRR, nDCG, geldigheid van citaten, groundedness- en citatiesteun-judges, uit retrieval-artefacten die je systeem vastlegt of teruggeeftSDK en YAMLDiagnose: diagnose vereist een gefaseerd systeem
RAG gebouwd in fasenAl het bovenstaande, caching per fase, en oloproof diagnose met gouden context, top-k- of rerankerwijzigingen naast een controleSDK @rag_system, YAML system.rag, CLI diagnoseInterventies buiten die drie
Agent die tools gebruiktStaplimieten, vereiste en verboden tools, toolvolgorde, lussen, beperkingen, uit een vastgelegd trajectSDK en YAMLEen door een LLM beoordeelde controle van trajectkwaliteit
Multi-agentsysteemRoutering, toolrechten per agent, limieten op overdrachtenSDK en YAMLn/a
Agent-replayEen case opnieuw draaien vanaf een checkpoint om een stap als nodig of niet te labelenAlleen SDK (replay_case), voor een systeem dat checkpoints ondersteuntEen CLI-commando
Binair classificatiemodelAccuracy, precisie, recall, Brier, log loss, rangschikking (AUC)SDK en YAML predictive:n/a
MultiklassemodelEén blok per klasse (één tegen de rest)SDK en YAMLMacro- of microgemiddelden
RegressiemodelAbsolute fout binnen een gedeclareerd target_rangeSDK en YAMLKwadratische fout, R kwadraat, onbegrensde fout
Gesprek met meerdere beurtenOf elke gescripte beurt beantwoord werd, en een rubric-judge over het hele gesprekAlleen SDK (ConversationCompleted, ConversationJudge)YAML-types, scores per beurt, een gebruikerssimulator, gespreksreplay
Afbeeldingen, audio, videoNiets native: een case kan een URL of gecodeerd bestand via je systeem meedragen, en @evaluator kan de uitvoer controlerenn/aJudges zien alleen JSON-tekst; geen media-artefacten of weergave

Een workaround voor meerdere beurten: maak van elke beurt een case en geef de beurten van één gesprek dezelfde group_id, zodat de analyse ze als een cluster behandelt (Clusters). Elke beurt is dan een aparte aanroep, geen enkele vastgelegde dialoog.

Je systeem aansluiten

  • Python-callable: @system in de SDK of system.callable: module:function in YAML. Het ontvangt de input van de case en geeft een dictionary terug. Synchrone en asynchrone functies werken allebei.
  • HTTP: system.http met url, method, output_path, artifacts en timeout_s. De invoer van de case wordt als JSON-body verzonden en het antwoord als JSON gelezen. Headers en authenticatie zijn nog niet configureerbaar; zet een endpoint dat een sleutel nodig heeft achter een callable die hem toevoegt.
  • Eigen evaluators: @evaluator in de SDK. oloproof.yaml kan er nog geen noemen.

Workflows

WorkflowWat werktNiet gebouwd
Twee versies vergelijkenGepaarde superioriteit, non-inferioriteit en equivalentie; slices met multipliciteitscontrolen/a
CIExitcodes van oloproof gate volgens de block_on van je policy, sign-off, ondertekende records; een samenvatting voor pull requests (--summary markdown)n/a
Menselijke beoordelingLabels uit een bestand of de terminal; een beoordelingswachtrij in de browser met toegewezen beoordelaars op een gehoste werkruimteEen beoordelingswachtrij in de browser op een lokaal project
BrowserwerkbankRuns, cases, vergelijkingen, diagnoses, evaluators, beoordeling en verkeer, na oloproof pushDatasetimport, judges opstellen, schema's, alerts en postmortems (getoond als gepland)
Lokale browsern/aGeen CLI-opdracht serveert de werkbank lokaal; die wordt gehost

Wat getest is, en hoe

Elke familie hierboven heeft geautomatiseerde tests, gedraaid op fixtures en gemockte providers. Runs tegen echte systemen met echte modellen zijn vastgelegd voor RAG, één agent en een gesprek met meerdere beurten; nog geen voor predictieve modellen of multi-agentsystemen. Statistische methoden die over releases beslissen, zijn elk toegelaten door hun eigen audit; een metriek zonder toegelaten interval beslist geen regel op een interval, en een regel die er een nodig zou hebben geeft MANUAL_REVIEW of INSUFFICIENT_EVIDENCE terug met de reden.