Panduan
Apa yang berfungsi hari ini
Apa yang dapat Anda evaluasi dengan Oloproof hari ini, bagaimana Anda menjangkaunya (Python SDK, oloproof.yaml dan CLI, atau browser), dan apa yang belum dibangun. Halaman ini diambil dari audit kapabilitas 8 Oktober 2026, sebuah tinjauan internal yang memeriksa setiap baris terhadap kode dan pengujiannya, bukan terhadap rencana.
Cara membaca halaman ini
"SDK" berarti paket Python (import oloproof). "YAML" berarti proyek yang Anda jalankan dengan oloproof run dari oloproof.yaml. Keduanya bukan permukaan yang sama: beberapa evaluator hanya ada di salah satunya, dan halaman ini menyebutkan yang mana. "Browser" berarti workbench yang di-hosting, yang menampilkan apa yang Anda kirim dengan oloproof push; workbench tidak menjalankan evaluasi yang belum Anda definisikan dalam kode atau YAML.
Oloproof memanggil sistem Anda; Oloproof tidak meng-hosting, mengisolasi, atau mengatur ulang sistem itu. Aplikasi Anda mengelola state, sesi, dan efek samping tool-nya sendiri selama run.
Menurut jenis sistem
| Sistem Anda | Apa yang berfungsi | Di mana | Belum dibangun |
|---|---|---|---|
| Classifier atau keluaran terstruktur | Kecocokan persis, contains, regex, skema JSON, juri rubrik, juri probabilitas, classifier model; tingkat kelulusan dengan interval | SDK dan YAML; model_classifier, probability_judge dan cascade hanya di YAML | n/a |
| Pembuatan teks, ringkasan, ekstraksi | Pemeriksaan yang sama atas teks bebas, juri rubrik, kesepakatan juri dengan label manusia, preferensi berpasangan | SDK dan YAML; preferensi adalah perintah oloproof prefer | BLEU, ROUGE, atau kemiripan embedding (tulis sendiri dengan @evaluator) |
| RAG yang Anda jalankan sebagai kotak hitam | Hit rate, recall, MRR, nDCG, validitas sitasi, juri groundedness dan dukungan sitasi, dari artefak retrieval yang direkam atau dikembalikan sistem Anda | SDK dan YAML | Diagnosis: diagnose memerlukan sistem bertahap |
| RAG yang dibangun bertahap | Semua di atas, caching per tahap, dan oloproof diagnose dengan konteks emas, perubahan top-k atau reranker di samping kontrol | SDK @rag_system, YAML system.rag, CLI diagnose | Intervensi di luar ketiganya |
| Agen yang memakai tool | Batas langkah, tool wajib dan terlarang, urutan tool, loop, batasan, dari trajektori yang direkam | SDK dan YAML | Pemeriksaan kualitas trajektori yang dinilai LLM |
| Sistem multi-agen | Routing, izin tool per agen, batas handoff | SDK dan YAML | n/a |
| Replay agen | Menjalankan ulang kasus dari checkpoint untuk melabeli sebuah langkah sebagai perlu atau tidak | Hanya SDK (replay_case), untuk sistem yang mendukung checkpoint | Perintah CLI |
| Model classifier biner | Akurasi, presisi, recall, Brier, log loss, peringkat (AUC) | SDK dan YAML predictive: | n/a |
| Model multikelas | Satu blok per kelas (satu melawan sisanya) | SDK dan YAML | Rata-rata makro atau mikro |
| Model regresi | Galat absolut dalam target_range yang dideklarasikan | SDK dan YAML | Galat kuadrat, R kuadrat, galat tak terbatas |
| Percakapan multi-giliran | Apakah setiap giliran yang diskenariokan dijawab, dan juri rubrik atas seluruh percakapan | Hanya SDK (ConversationCompleted, ConversationJudge) | Tipe YAML, skor per giliran, simulator pengguna, replay percakapan |
| Gambar, audio, video | Tidak ada yang native: kasus dapat membawa URL atau file terenkode melalui sistem Anda, dan @evaluator dapat memeriksa keluarannya | n/a | Juri hanya melihat teks JSON; tanpa artefak media atau rendering |
Solusi sementara untuk multi-giliran: jadikan setiap giliran sebuah kasus dan beri giliran-giliran dari satu percakapan group_id yang sama, sehingga analisis memperlakukannya sebagai klaster (Klaster). Setiap giliran kemudian menjadi panggilan terpisah, bukan satu dialog yang direkam.
Menghubungkan sistem Anda
- Callable Python: @system di SDK atau system.callable: module:function di YAML. Callable ini menerima input kasus dan mengembalikan dictionary. Fungsi sinkron dan asinkron sama-sama berfungsi.
- HTTP: system.http dengan url, method, output_path, artifacts dan timeout_s. Input kasus dikirim sebagai body JSON dan responsnya dibaca sebagai JSON. Header dan autentikasi belum dapat dikonfigurasi; letakkan endpoint yang memerlukan key di balik callable yang menambahkannya.
- Evaluator kustom: @evaluator di SDK. oloproof.yaml belum dapat menamai satu pun.
Alur kerja
| Alur kerja | Apa yang berfungsi | Belum dibangun |
|---|---|---|
| Membandingkan dua versi | Superioritas berpasangan, non-inferioritas dan ekuivalensi; slice dengan kontrol multiplisitas | n/a |
| CI | Kode keluar oloproof gate dari block_on kebijakan Anda, sign-off, catatan bertanda tangan; ringkasan pull request (--summary markdown) | n/a |
| Tinjauan manusia | Label dari file atau terminal; antrean tinjauan di browser dengan peninjau yang ditugaskan pada workspace yang di-hosting | Antrean tinjauan di browser pada proyek lokal |
| Workbench browser | Run, kasus, perbandingan, diagnostik, evaluator, tinjauan dan traffic, setelah oloproof push | Impor dataset, penyusunan juri, jadwal, peringatan dan postmortem (ditampilkan sebagai rencana) |
| Browser lokal | n/a | Tidak ada perintah CLI yang menyajikan workbench secara lokal; workbench di-hosting |
Apa yang telah diuji, dan bagaimana
Setiap keluarga di atas memiliki pengujian otomatis, dijalankan pada fixture dan provider tiruan. Run terhadap sistem nyata dengan model nyata direkam untuk RAG, satu agen, dan satu percakapan multi-giliran; belum ada untuk model prediktif atau sistem multi-agen. Metode statistik yang memutuskan rilis masing-masing disetujui oleh auditnya sendiri; metrik tanpa interval yang disetujui tidak memutuskan aturan berdasarkan interval, dan aturan yang memerlukannya mengembalikan MANUAL_REVIEW atau INSUFFICIENT_EVIDENCE beserta alasannya.