Panduan
Mulai di sini
Apa yang dilakukan Oloproof, kapan menggunakannya dan kapan tidak, serta urutan membaca panduan ini: dari evaluasi pertama atas satu aplikasi hingga membandingkan versi, tinjauan, CI, dan kontrak yang persis.
Apa yang dilakukan Oloproof
Oloproof menjalankan aplikasi AI Anda atas sekumpulan kasus yang tetap, memeriksa setiap keluaran dengan evaluator yang Anda pilih, dan mengubah hasilnya menjadi tingkat dengan interval. Kebijakan rilis yang Anda tulis kemudian memutuskan setiap aturan sebagai PASS, FAIL, INSUFFICIENT_EVIDENCE, atau MANUAL_REVIEW, dan perintah keluar sesuai keputusan itu sehingga CI dapat memakainya. Semuanya berjalan di mesin Anda; tidak ada yang keluar darinya kecuali Anda melakukan push sebuah eksekusi ke ruang kerja yang di-hosting. Istilah-istilahnya didefinisikan dalam Konsep inti.
Gunakan saat Anda perlu tahu apakah sebuah aplikasi memenuhi standar yang dinyatakan pada kasus yang Anda percayai, seberapa yakin jawaban itu, dan apakah sebuah perubahan membuatnya lebih baik atau lebih buruk. Oloproof memanggil sistem Anda; Oloproof tidak meng-hosting, mengisolasi, atau mengatur ulang sistem itu, dan aplikasi Anda memiliki sendiri state, sesi, dan efek samping alatnya. Untuk apa yang sudah dan belum dibangun, menurut jenis sistem, baca Apa yang berfungsi hari ini sebelum Anda berkomitmen menggunakannya.
Panduan ini menjelaskan Oloproof 0.1.0a5. pip show oloproof mencetak versi yang terpasang pada Anda; versi lama mungkin tidak memiliki perintah atau flag yang ditampilkan di sini, seperti oloproof init --example, dan pip install --upgrade --pre oloproof memperbaruinya.
Perjalanannya
| Langkah | Apa yang Anda lakukan | Baca |
|---|---|---|
| 1 | Pelajari apa yang dilakukan Oloproof dan kapan menggunakannya | Halaman ini, Konsep inti, Apa yang berfungsi hari ini |
| 2 | Evaluasi aplikasi pertama Anda, tanpa baseline | Mulai cepat |
| 3 | Pilih panduan untuk jenis sistem Anda | Tabel di bawah |
| 4 | Periksa kegagalan dan pahami hasilnya | Suite, Error, Kasus berkelompok, Irisan |
| 5 | Ubah sistem dan bandingkan versi | Perbandingan, Aturan perbandingan |
| 6 | Tambahkan tinjauan manusia, kolaborasi, dan CI | Juri, Gerbang, CI, Notifikasi |
| 7 | Cari kontrak teknis yang persis | Konfigurasi, Referensi SDK, Hasil, CLI |
Evaluasi pertama tidak memerlukan baseline: evaluasi itu menanyakan apakah satu versi aplikasi Anda memenuhi persyaratan Anda. Membandingkan dua versi datang pada langkah 5, setelah Anda memiliki eksekusi yang layak dijadikan pembanding.
Pilih jenis sistem Anda
| Sistem Anda | Mulai dengan |
|---|---|
| Classifier, router, atau keluaran terstruktur (sebuah label, sebuah objek JSON) | Klasifikasi |
| Teks bebas: jawaban, ringkasan, ekstraksi | Pembuatan teks |
| Layanan yang Anda jangkau lewat HTTP, dalam bahasa apa pun | Endpoint HTTP |
| Retrieval augmented generation | RAG |
| Agen yang menggunakan alat, atau beberapa agen | Agen |
| Model prediktif terlatih (klasifikasi atau regresi) | Model prediktif |
| Percakapan multi-giliran | Percakapan |
Gambar, audio, dan video tidak memiliki dukungan bawaan: sebuah kasus dapat membawa URL atau file yang dienkode melalui sistem Anda, dan evaluator kustom dapat memeriksa keluarannya, tetapi juri hanya melihat teks JSON.