Anleitungen
Hier beginnen
Was Oloproof tut, wann Sie es einsetzen sollten und wann nicht, und in welcher Reihenfolge Sie diese Anleitungen lesen: von einer ersten Evaluation einer Anwendung bis zum Vergleich von Versionen, Review, CI und den genauen Verträgen.
Was Oloproof tut
Oloproof führt Ihre KI-Anwendung über eine feste Menge von Fällen aus, prüft jede Ausgabe mit Evaluatoren Ihrer Wahl und macht aus den Ergebnissen Raten mit Intervallen. Eine Release-Policy, die Sie schreiben, entscheidet dann jede Regel als PASS, FAIL, INSUFFICIENT_EVIDENCE oder MANUAL_REVIEW, und der Befehl endet mit einem Exit-Code nach dieser Entscheidung, sodass CI ihn nutzen kann. Alles läuft auf Ihrem Rechner; nichts verlässt ihn, solange Sie keinen Lauf in einen gehosteten Workspace pushen. Die Begriffe sind in Kernkonzepte definiert.
Setzen Sie es ein, wenn Sie wissen müssen, ob eine Anwendung eine festgelegte Messlatte auf Fällen erfüllt, denen Sie vertrauen, wie sicher diese Antwort ist und ob eine Änderung sie besser oder schlechter gemacht hat. Oloproof ruft Ihr System auf; es hostet, isoliert oder setzt es nicht zurück, und Ihre Anwendung verwaltet ihren eigenen Zustand, ihre Sitzungen und die Nebenwirkungen ihrer Tools. Was gebaut ist und was nicht, nach Art des Systems, steht in Was heute funktioniert; lesen Sie es, bevor Sie sich festlegen.
Diese Anleitungen beschreiben Oloproof 0.1.0a5. pip show oloproof gibt die installierte Version aus; einer älteren fehlt möglicherweise ein hier gezeigter Befehl oder ein Flag, etwa oloproof init --example, und pip install --upgrade --pre oloproof bringt sie auf den aktuellen Stand.
Der Weg
| Schritt | Was Sie tun | Lesen |
|---|---|---|
| 1 | Erfahren, was Oloproof tut und wann man es einsetzt | Diese Seite, Kernkonzepte, Was heute funktioniert |
| 2 | Ihre erste Anwendung evaluieren, ohne Baseline | Schnellstart |
| 3 | Eine Anleitung für Ihre Art von System wählen | Die Tabelle unten |
| 4 | Fehlschläge untersuchen und das Ergebnis verstehen | Suiten, Fehler, Geclusterte Fälle, Slices |
| 5 | Das System ändern und Versionen vergleichen | Vergleichen, Vergleichsregeln |
| 6 | Menschliches Review, Zusammenarbeit und CI ergänzen | Judges, Gating, CI, Benachrichtigungen |
| 7 | Genaue technische Verträge nachschlagen | Konfiguration, SDK-Referenz, Ergebnisse, CLI |
Eine erste Evaluation braucht keine Baseline: Sie fragt, ob eine Version Ihrer Anwendung Ihre Anforderungen erfüllt. Der Vergleich zweier Versionen kommt in Schritt 5, sobald Sie einen Lauf haben, mit dem sich ein Vergleich lohnt.
Wählen Sie Ihre Art von System
| Ihr System | Beginnen Sie mit |
|---|---|
| Ein Klassifikator, Router oder strukturierte Ausgabe (ein Label, ein JSON-Objekt) | Klassifikation |
| Freier Text: Antworten, Zusammenfassungen, Extraktion | Textgenerierung |
| Ein Dienst, den Sie über HTTP erreichen, in beliebiger Sprache | Ein HTTP-Endpunkt |
| Retrieval Augmented Generation | RAG |
| Ein Agent, der Tools nutzt, oder mehrere Agenten | Agenten |
| Ein trainiertes prädiktives Modell (Klassifikation oder Regression) | Prädiktive Modelle |
| Ein Gespräch über mehrere Runden | Gespräche |
Bilder, Audio und Video werden nicht nativ unterstützt: Ein Fall kann eine URL oder eine kodierte Datei durch Ihr System tragen, und ein eigener Evaluator kann die Ausgabe prüfen, aber Judges sehen nur JSON-Text.