Vergelijking
Oloproof versus ad-hoc prompttests.
Steekproeven in een playground zijn snel en echt nuttig zolang je aan het verkennen bent. Ze volstaan niet meer zodra een wijziging bij gebruikers terechtkomt.
| Vraag | Steekproef in een playground | Oloproof |
|---|---|---|
| Is de kwaliteit veranderd? | Een gevoel op basis van een handvol outputs | Een verschil met een 95%-interval over de gepaarde cases, en een beslissing op basis van het interval |
| Voor wie is het veranderd? | Onbekend | Per gedeclareerde slice: taal, intentie of een willekeurige metadatasleutel, de eerste tool die een agent aanriep, zijn route |
| Kun je het volgend kwartaal opnieuw draaien? | Nee: de prompts en cases zijn weg | Ja: de suite, de systeemversie en de evaluatorversies zijn content-addressed, en een steekproef bewaart zijn seed |
| Houdt het een slechte release tegen? | Alleen als iemand eraan denkt te kijken | De gate eindigt met een exitcode die niet nul is en de CI-job faalt: 1 als een regel faalt, 3 als het bewijs niet beslist |
| Wat laat je aan risicomanagement of een klant zien? | Screenshots in een thread | Een geëxporteerde bundel: de run, zijn suite, systeem, evaluators, cases en goedkeuringen |
| Tijd tot het eerste signaal | Minuten | Minuten lokaal, daarna bij elke wijziging waarop je CI het draait |
Waar steekproeven nog steeds winnen
Vroege verkenning, het debuggen van één vreemde output en snelle controles terwijl je een prompt schrijft. Blijf dat doen. Een evaluatiesuite bouw je zodra het gedrag belangrijk genoeg is om te verdedigen.