Handleidingen
Begin hier
Wat Oloproof doet, wanneer je het gebruikt en wanneer niet, en in welke volgorde je deze gidsen leest: van een eerste evaluatie van één applicatie tot versies vergelijken, review, CI en de exacte contracten.
Wat Oloproof doet
Oloproof draait je AI-applicatie over een vaste set cases, controleert elke uitvoer met evaluators die jij kiest en zet de resultaten om in percentages met intervallen. Een releasepolicy die jij schrijft beslist daarna elke regel als PASS, FAIL, INSUFFICIENT_EVIDENCE of MANUAL_REVIEW, en het commando eindigt op die beslissing zodat CI het kan gebruiken. Alles draait op je eigen machine; er verlaat niets die machine tenzij je een run naar een gehoste workspace pusht. De termen worden gedefinieerd in Kernbegrippen.
Gebruik het als je wilt weten of een applicatie een vastgelegde lat haalt op cases die je vertrouwt, hoe zeker dat antwoord is, en of een wijziging het beter of slechter maakte. Oloproof roept je systeem aan; het host, sandboxt of reset het niet, en je applicatie beheert haar eigen toestand, sessies en neveneffecten van tools. Lees voor wat wel en niet gebouwd is, per soort systeem, Wat vandaag werkt voordat je je eraan verbindt.
Deze gidsen beschrijven Oloproof 0.1.0a5. pip show oloproof toont de versie die je hebt geïnstalleerd; een oudere mist mogelijk een commando of vlag die hier staat, zoals oloproof init --example, en pip install --upgrade --pre oloproof werkt hem bij.
De route
| Stap | Wat je doet | Lees |
|---|---|---|
| 1 | Leer wat Oloproof doet en wanneer je het gebruikt | Deze pagina, Kernbegrippen, Wat vandaag werkt |
| 2 | Evalueer je eerste applicatie, zonder baseline | Snel aan de slag |
| 3 | Kies een gids voor jouw soort systeem | De tabel hieronder |
| 4 | Bekijk mislukkingen en begrijp het resultaat | Suites, Fouten, Geclusterde cases, Slices |
| 5 | Wijzig het systeem en vergelijk versies | Vergelijken, Vergelijkingsregels |
| 6 | Voeg menselijke review, samenwerking en CI toe | Judges, Gating, CI, Meldingen |
| 7 | Zoek exacte technische contracten op | Configuratie, SDK-referentie, Resultaten, CLI |
Een eerste evaluatie heeft geen baseline nodig: ze vraagt of één versie van je applicatie aan je eisen voldoet. Twee versies vergelijken komt bij stap 5, zodra je een run hebt die het waard is om mee te vergelijken.
Kies je soort systeem
| Jouw systeem | Begin met |
|---|---|
| Een classifier, router of gestructureerde uitvoer (een label, een JSON-object) | Classificatie |
| Vrije tekst: antwoorden, samenvattingen, extractie | Tekstgeneratie |
| Een dienst die je via HTTP bereikt, in elke taal | Een HTTP-endpoint |
| Retrieval augmented generation | RAG |
| Een agent die tools gebruikt, of meerdere agents | Agents |
| Een getraind voorspellend model (classificatie of regressie) | Voorspellende modellen |
| Een gesprek met meerdere beurten | Gesprekken |
Afbeeldingen, audio en video hebben geen native ondersteuning: een case kan een URL of een gecodeerd bestand door je systeem dragen, en een eigen evaluator kan de uitvoer controleren, maar judges zien alleen JSON-tekst.