Guides
Commencer ici
Ce que fait Oloproof, quand l'utiliser et quand ne pas l'utiliser, et l'ordre dans lequel lire ces guides : d'une première évaluation d'une application jusqu'à la comparaison de versions, la revue, la CI et les contrats exacts.
Ce que fait Oloproof
Oloproof exécute votre application d'IA sur un ensemble fixe de cas, vérifie chaque sortie avec les évaluateurs que vous choisissez, et transforme les résultats en taux assortis d'intervalles. Une politique de publication que vous écrivez décide ensuite chaque règle comme PASS, FAIL, INSUFFICIENT_EVIDENCE ou MANUAL_REVIEW, et la commande se termine sur cette décision pour que la CI puisse l'utiliser. Tout s'exécute sur votre machine ; rien n'en sort à moins que vous ne poussiez une exécution vers un espace de travail hébergé. Les termes sont définis dans Concepts fondamentaux.
Utilisez-le quand vous devez savoir si une application atteint un niveau déclaré sur des cas de confiance, à quel point cette réponse est sûre, et si un changement l'a améliorée ou dégradée. Oloproof appelle votre système ; il ne l'héberge pas, ne l'isole pas et ne le réinitialise pas, et votre application possède son propre état, ses sessions et les effets de bord de ses outils. Pour ce qui est construit ou non, par type de système, lisez Ce qui fonctionne aujourd'hui avant de vous engager.
Ces guides décrivent Oloproof 0.1.0a5. pip show oloproof affiche la version que vous avez installée ; une version plus ancienne peut ne pas avoir une commande ou une option montrée ici, comme oloproof init --example, et pip install --upgrade --pre oloproof la met à jour.
Le parcours
| Étape | Ce que vous faites | À lire |
|---|---|---|
| 1 | Comprendre ce que fait Oloproof et quand l'utiliser | Cette page, Concepts fondamentaux, Ce qui fonctionne aujourd'hui |
| 2 | Évaluer votre première application, sans référence | Démarrage rapide |
| 3 | Choisir un guide pour votre type de système | Le tableau ci-dessous |
| 4 | Inspecter les échecs et comprendre le résultat | Suites, Erreurs, Cas groupés, Segments |
| 5 | Modifier le système et comparer des versions | Comparer, Règles de comparaison |
| 6 | Ajouter la revue humaine, la collaboration et la CI | Juges, Portes, CI, Notifications |
| 7 | Consulter les contrats techniques exacts | Configuration, Référence du SDK, Résultats, CLI |
Une première évaluation n'a pas besoin de référence : elle demande si une version de votre application satisfait vos exigences. La comparaison de deux versions vient à l'étape 5, une fois que vous disposez d'une exécution à laquelle il vaut la peine de comparer.
Choisir votre type de système
| Votre système | Commencez par |
|---|---|
| Un classifieur, un routeur ou une sortie structurée (une étiquette, un objet JSON) | Classification |
| Du texte libre : réponses, résumés, extraction | Génération de texte |
| Un service joignable en HTTP, dans n'importe quel langage | Un point de terminaison HTTP |
| La génération augmentée par la recherche | RAG |
| Un agent qui utilise des outils, ou plusieurs agents | Agents |
| Un modèle prédictif entraîné (classification ou régression) | Modèles prédictifs |
| Une conversation à plusieurs tours | Conversations |
Les images, l'audio et la vidéo n'ont pas de prise en charge native : un cas peut transporter une URL ou un fichier encodé à travers votre système, et un évaluateur personnalisé peut vérifier la sortie, mais les juges ne voient que du texte JSON.