Zum Inhalt springen

Anleitungen

Hier beginnen

Was Oloproof tut, wann Sie es einsetzen sollten und wann nicht, und in welcher Reihenfolge Sie diese Anleitungen lesen: von einer ersten Evaluation einer Anwendung bis zum Vergleich von Versionen, Review, CI und den genauen Verträgen.

Was Oloproof tut

Oloproof führt Ihre KI-Anwendung über eine feste Menge von Fällen aus, prüft jede Ausgabe mit Evaluatoren Ihrer Wahl und macht aus den Ergebnissen Raten mit Intervallen. Eine Release-Policy, die Sie schreiben, entscheidet dann jede Regel als PASS, FAIL, INSUFFICIENT_EVIDENCE oder MANUAL_REVIEW, und der Befehl endet mit einem Exit-Code nach dieser Entscheidung, sodass CI ihn nutzen kann. Alles läuft auf Ihrem Rechner; nichts verlässt ihn, solange Sie keinen Lauf in einen gehosteten Workspace pushen. Die Begriffe sind in Kernkonzepte definiert.

Setzen Sie es ein, wenn Sie wissen müssen, ob eine Anwendung eine festgelegte Messlatte auf Fällen erfüllt, denen Sie vertrauen, wie sicher diese Antwort ist und ob eine Änderung sie besser oder schlechter gemacht hat. Oloproof ruft Ihr System auf; es hostet, isoliert oder setzt es nicht zurück, und Ihre Anwendung verwaltet ihren eigenen Zustand, ihre Sitzungen und die Nebenwirkungen ihrer Tools. Was gebaut ist und was nicht, nach Art des Systems, steht in Was heute funktioniert; lesen Sie es, bevor Sie sich festlegen.

Diese Anleitungen beschreiben Oloproof 0.1.0a5. pip show oloproof gibt die installierte Version aus; einer älteren fehlt möglicherweise ein hier gezeigter Befehl oder ein Flag, etwa oloproof init --example, und pip install --upgrade --pre oloproof bringt sie auf den aktuellen Stand.

Der Weg

SchrittWas Sie tunLesen
1Erfahren, was Oloproof tut und wann man es einsetztDiese Seite, Kernkonzepte, Was heute funktioniert
2Ihre erste Anwendung evaluieren, ohne BaselineSchnellstart
3Eine Anleitung für Ihre Art von System wählenDie Tabelle unten
4Fehlschläge untersuchen und das Ergebnis verstehenSuiten, Fehler, Geclusterte Fälle, Slices
5Das System ändern und Versionen vergleichenVergleichen, Vergleichsregeln
6Menschliches Review, Zusammenarbeit und CI ergänzenJudges, Gating, CI, Benachrichtigungen
7Genaue technische Verträge nachschlagenKonfiguration, SDK-Referenz, Ergebnisse, CLI

Eine erste Evaluation braucht keine Baseline: Sie fragt, ob eine Version Ihrer Anwendung Ihre Anforderungen erfüllt. Der Vergleich zweier Versionen kommt in Schritt 5, sobald Sie einen Lauf haben, mit dem sich ein Vergleich lohnt.

Wählen Sie Ihre Art von System

Ihr SystemBeginnen Sie mit
Ein Klassifikator, Router oder strukturierte Ausgabe (ein Label, ein JSON-Objekt)Klassifikation
Freier Text: Antworten, Zusammenfassungen, ExtraktionTextgenerierung
Ein Dienst, den Sie über HTTP erreichen, in beliebiger SpracheEin HTTP-Endpunkt
Retrieval Augmented GenerationRAG
Ein Agent, der Tools nutzt, oder mehrere AgentenAgenten
Ein trainiertes prädiktives Modell (Klassifikation oder Regression)Prädiktive Modelle
Ein Gespräch über mehrere RundenGespräche

Bilder, Audio und Video werden nicht nativ unterstützt: Ein Fall kann eine URL oder eine kodierte Datei durch Ihr System tragen, und ein eigener Evaluator kann die Ausgabe prüfen, aber Judges sehen nur JSON-Text.