Vergleich
Oloproof im Vergleich zu Ad-hoc-Prompt-Tests.
Stichproben in einem Playground sind schnell und wirklich nützlich, solange Sie explorieren. Sie reichen nicht mehr aus, sobald eine Änderung bei Nutzern ankommt.
| Frage | Playground-Stichprobe | Oloproof |
|---|---|---|
| Hat sich die Qualität verändert? | Ein Gefühl aus einer Handvoll Ausgaben | Eine Differenz mit einem 95%-Intervall über die gepaarten Fälle, und eine Entscheidung auf Grundlage des Intervalls |
| Für wen hat es sich verändert? | Unbekannt | Pro deklariertem Slice: Sprache, Intent oder ein beliebiger Metadatenschlüssel, das erste Tool, das ein Agent aufgerufen hat, seine Route |
| Können Sie es nächstes Quartal erneut ausführen? | Nein: Die Prompts und Fälle sind weg | Ja: Suite, Systemversion und Evaluatorversionen sind inhaltsadressiert, und eine Stichprobe behält ihren Seed |
| Blockiert es ein schlechtes Release? | Nur wenn jemand daran denkt, nachzusehen | Das Gate endet mit einem Exit-Code ungleich null und der CI-Job schlägt fehl: 1, wenn eine Regel scheitert, 3, wenn die Evidenz nicht entscheidet |
| Was zeigen Sie dem Risikomanagement oder einem Kunden? | Screenshots in einem Thread | Ein exportiertes Bundle: der Lauf, seine Suite, sein System, seine Evaluatoren, Fälle und Freigaben |
| Zeit bis zum ersten Signal | Minuten | Minuten lokal, danach bei jeder Änderung, bei der Ihre CI es ausführt |
Wo Stichproben weiterhin gewinnen
Frühe Exploration, das Debuggen einer einzelnen seltsamen Ausgabe und Plausibilitätsprüfungen, während Sie einen Prompt schreiben. Machen Sie das weiter. Eine Evaluationssuite bauen Sie, sobald das Verhalten wichtig genug ist, um es zu verteidigen.