Skip to content

Vergelijking

Oloproof versus ad-hoc prompttests.

Steekproeven in een playground zijn snel en echt nuttig zolang je aan het verkennen bent. Ze volstaan niet meer zodra een wijziging bij gebruikers terechtkomt.

Vragen die een team over een wijziging stelt, beantwoord door een steekproef in een playground en door Oloproof
VraagSteekproef in een playgroundOloproof
Is de kwaliteit veranderd?Een gevoel op basis van een handvol outputsEen verschil met een 95%-interval over de gepaarde cases, en een beslissing op basis van het interval
Voor wie is het veranderd?OnbekendPer gedeclareerde slice: taal, intentie of een willekeurige metadatasleutel, de eerste tool die een agent aanriep, zijn route
Kun je het volgend kwartaal opnieuw draaien?Nee: de prompts en cases zijn wegJa: de suite, de systeemversie en de evaluatorversies zijn content-addressed, en een steekproef bewaart zijn seed
Houdt het een slechte release tegen?Alleen als iemand eraan denkt te kijkenDe gate eindigt met een exitcode die niet nul is en de CI-job faalt: 1 als een regel faalt, 3 als het bewijs niet beslist
Wat laat je aan risicomanagement of een klant zien?Screenshots in een threadEen geëxporteerde bundel: de run, zijn suite, systeem, evaluators, cases en goedkeuringen
Tijd tot het eerste signaalMinutenMinuten lokaal, daarna bij elke wijziging waarop je CI het draait

Waar steekproeven nog steeds winnen

Vroege verkenning, het debuggen van één vreemde output en snelle controles terwijl je een prompt schrijft. Blijf dat doen. Een evaluatiesuite bouw je zodra het gedrag belangrijk genoeg is om te verdedigen.