Ga naar de inhoud

Handleidingen

Begin hier

Wat Oloproof doet, wanneer je het gebruikt en wanneer niet, en in welke volgorde je deze gidsen leest: van een eerste evaluatie van één applicatie tot versies vergelijken, review, CI en de exacte contracten.

Wat Oloproof doet

Oloproof draait je AI-applicatie over een vaste set cases, controleert elke uitvoer met evaluators die jij kiest en zet de resultaten om in percentages met intervallen. Een releasepolicy die jij schrijft beslist daarna elke regel als PASS, FAIL, INSUFFICIENT_EVIDENCE of MANUAL_REVIEW, en het commando eindigt op die beslissing zodat CI het kan gebruiken. Alles draait op je eigen machine; er verlaat niets die machine tenzij je een run naar een gehoste workspace pusht. De termen worden gedefinieerd in Kernbegrippen.

Gebruik het als je wilt weten of een applicatie een vastgelegde lat haalt op cases die je vertrouwt, hoe zeker dat antwoord is, en of een wijziging het beter of slechter maakte. Oloproof roept je systeem aan; het host, sandboxt of reset het niet, en je applicatie beheert haar eigen toestand, sessies en neveneffecten van tools. Lees voor wat wel en niet gebouwd is, per soort systeem, Wat vandaag werkt voordat je je eraan verbindt.

Deze gidsen beschrijven Oloproof 0.1.0a5. pip show oloproof toont de versie die je hebt geïnstalleerd; een oudere mist mogelijk een commando of vlag die hier staat, zoals oloproof init --example, en pip install --upgrade --pre oloproof werkt hem bij.

De route

StapWat je doetLees
1Leer wat Oloproof doet en wanneer je het gebruiktDeze pagina, Kernbegrippen, Wat vandaag werkt
2Evalueer je eerste applicatie, zonder baselineSnel aan de slag
3Kies een gids voor jouw soort systeemDe tabel hieronder
4Bekijk mislukkingen en begrijp het resultaatSuites, Fouten, Geclusterde cases, Slices
5Wijzig het systeem en vergelijk versiesVergelijken, Vergelijkingsregels
6Voeg menselijke review, samenwerking en CI toeJudges, Gating, CI, Meldingen
7Zoek exacte technische contracten opConfiguratie, SDK-referentie, Resultaten, CLI

Een eerste evaluatie heeft geen baseline nodig: ze vraagt of één versie van je applicatie aan je eisen voldoet. Twee versies vergelijken komt bij stap 5, zodra je een run hebt die het waard is om mee te vergelijken.

Kies je soort systeem

Jouw systeemBegin met
Een classifier, router of gestructureerde uitvoer (een label, een JSON-object)Classificatie
Vrije tekst: antwoorden, samenvattingen, extractieTekstgeneratie
Een dienst die je via HTTP bereikt, in elke taalEen HTTP-endpoint
Retrieval augmented generationRAG
Een agent die tools gebruikt, of meerdere agentsAgents
Een getraind voorspellend model (classificatie of regressie)Voorspellende modellen
Een gesprek met meerdere beurtenGesprekken

Afbeeldingen, audio en video hebben geen native ondersteuning: een case kan een URL of een gecodeerd bestand door je systeem dragen, en een eigen evaluator kan de uitvoer controleren, maar judges zien alleen JSON-tekst.