Langsung ke konten

Panduan

Mulai di sini

Apa yang dilakukan Oloproof, kapan menggunakannya dan kapan tidak, serta urutan membaca panduan ini: dari evaluasi pertama atas satu aplikasi hingga membandingkan versi, tinjauan, CI, dan kontrak yang persis.

Apa yang dilakukan Oloproof

Oloproof menjalankan aplikasi AI Anda atas sekumpulan kasus yang tetap, memeriksa setiap keluaran dengan evaluator yang Anda pilih, dan mengubah hasilnya menjadi tingkat dengan interval. Kebijakan rilis yang Anda tulis kemudian memutuskan setiap aturan sebagai PASS, FAIL, INSUFFICIENT_EVIDENCE, atau MANUAL_REVIEW, dan perintah keluar sesuai keputusan itu sehingga CI dapat memakainya. Semuanya berjalan di mesin Anda; tidak ada yang keluar darinya kecuali Anda melakukan push sebuah eksekusi ke ruang kerja yang di-hosting. Istilah-istilahnya didefinisikan dalam Konsep inti.

Gunakan saat Anda perlu tahu apakah sebuah aplikasi memenuhi standar yang dinyatakan pada kasus yang Anda percayai, seberapa yakin jawaban itu, dan apakah sebuah perubahan membuatnya lebih baik atau lebih buruk. Oloproof memanggil sistem Anda; Oloproof tidak meng-hosting, mengisolasi, atau mengatur ulang sistem itu, dan aplikasi Anda memiliki sendiri state, sesi, dan efek samping alatnya. Untuk apa yang sudah dan belum dibangun, menurut jenis sistem, baca Apa yang berfungsi hari ini sebelum Anda berkomitmen menggunakannya.

Panduan ini menjelaskan Oloproof 0.1.0a5. pip show oloproof mencetak versi yang terpasang pada Anda; versi lama mungkin tidak memiliki perintah atau flag yang ditampilkan di sini, seperti oloproof init --example, dan pip install --upgrade --pre oloproof memperbaruinya.

Perjalanannya

LangkahApa yang Anda lakukanBaca
1Pelajari apa yang dilakukan Oloproof dan kapan menggunakannyaHalaman ini, Konsep inti, Apa yang berfungsi hari ini
2Evaluasi aplikasi pertama Anda, tanpa baselineMulai cepat
3Pilih panduan untuk jenis sistem AndaTabel di bawah
4Periksa kegagalan dan pahami hasilnyaSuite, Error, Kasus berkelompok, Irisan
5Ubah sistem dan bandingkan versiPerbandingan, Aturan perbandingan
6Tambahkan tinjauan manusia, kolaborasi, dan CIJuri, Gerbang, CI, Notifikasi
7Cari kontrak teknis yang persisKonfigurasi, Referensi SDK, Hasil, CLI

Evaluasi pertama tidak memerlukan baseline: evaluasi itu menanyakan apakah satu versi aplikasi Anda memenuhi persyaratan Anda. Membandingkan dua versi datang pada langkah 5, setelah Anda memiliki eksekusi yang layak dijadikan pembanding.

Pilih jenis sistem Anda

Sistem AndaMulai dengan
Classifier, router, atau keluaran terstruktur (sebuah label, sebuah objek JSON)Klasifikasi
Teks bebas: jawaban, ringkasan, ekstraksiPembuatan teks
Layanan yang Anda jangkau lewat HTTP, dalam bahasa apa punEndpoint HTTP
Retrieval augmented generationRAG
Agen yang menggunakan alat, atau beberapa agenAgen
Model prediktif terlatih (klasifikasi atau regresi)Model prediktif
Percakapan multi-giliranPercakapan

Gambar, audio, dan video tidak memiliki dukungan bawaan: sebuah kasus dapat membawa URL atau file yang dienkode melalui sistem Anda, dan evaluator kustom dapat memeriksa keluarannya, tetapi juri hanya melihat teks JSON.