Guide
Inizia da qui
Che cosa fa Oloproof, quando usarlo e quando no, e l'ordine in cui leggere queste guide: dalla prima valutazione di un'applicazione al confronto tra versioni, alla revisione, alla CI e ai contratti esatti.
Che cosa fa Oloproof
Oloproof esegue la tua applicazione di IA su un insieme fisso di casi, controlla ogni output con i valutatori che scegli e trasforma i risultati in tassi con intervalli. Una policy di rilascio che scrivi tu decide poi ogni regola come PASS, FAIL, INSUFFICIENT_EVIDENCE o MANUAL_REVIEW, e il comando esce su quella decisione così che la CI possa usarla. Tutto gira sulla tua macchina; nulla ne esce a meno che tu non faccia il push di un'esecuzione in uno spazio di lavoro ospitato. I termini sono definiti in Concetti fondamentali.
Usalo quando devi sapere se un'applicazione raggiunge un livello dichiarato su casi di cui ti fidi, quanto è sicura quella risposta, e se una modifica l'ha resa migliore o peggiore. Oloproof chiama il tuo sistema; non lo ospita, non lo isola e non lo reimposta, e la tua applicazione gestisce da sé il proprio stato, le sessioni e gli effetti collaterali degli strumenti. Per ciò che è costruito e ciò che non lo è, per tipo di sistema, leggi Cosa funziona oggi prima di impegnarti.
Queste guide descrivono Oloproof 0.1.0a5. pip show oloproof stampa la versione che hai installato; una più vecchia può non avere un comando o un'opzione mostrati qui, come oloproof init --example, e pip install --upgrade --pre oloproof la aggiorna.
Il percorso
| Passo | Che cosa fai | Leggi |
|---|---|---|
| 1 | Capire che cosa fa Oloproof e quando usarlo | Questa pagina, Concetti fondamentali, Cosa funziona oggi |
| 2 | Valutare la tua prima applicazione, senza baseline | Guida rapida |
| 3 | Scegliere una guida per il tuo tipo di sistema | La tabella qui sotto |
| 4 | Esaminare i fallimenti e capire il risultato | Suite, Errori, Casi raggruppati, Slice |
| 5 | Modificare il sistema e confrontare versioni | Confronto, Regole di confronto |
| 6 | Aggiungere revisione umana, collaborazione e CI | Giudici, Gating, CI, Notifiche |
| 7 | Consultare i contratti tecnici esatti | Configurazione, Riferimento dell'SDK, Risultati, CLI |
Una prima valutazione non ha bisogno di una baseline: chiede se una versione della tua applicazione soddisfa i tuoi requisiti. Il confronto tra due versioni arriva al passo 5, quando hai un'esecuzione con cui valga la pena confrontarsi.
Scegli il tuo tipo di sistema
| Il tuo sistema | Inizia con |
|---|---|
| Un classificatore, un router o un output strutturato (un'etichetta, un oggetto JSON) | Classificazione |
| Testo libero: risposte, riassunti, estrazione | Generazione di testo |
| Un servizio che raggiungi via HTTP, in qualsiasi linguaggio | Un endpoint HTTP |
| Generazione aumentata dal recupero | RAG |
| Un agente che usa strumenti, o più agenti | Agenti |
| Un modello predittivo addestrato (classificazione o regressione) | Modelli predittivi |
| Una conversazione a più turni | Conversazioni |
Immagini, audio e video non hanno supporto nativo: un caso può trasportare un URL o un file codificato attraverso il tuo sistema, e un valutatore personalizzato può controllare l'output, ma i giudici vedono solo testo JSON.