Langsung ke konten

Panduan

Apa yang berfungsi hari ini

Apa yang dapat Anda evaluasi dengan Oloproof hari ini, bagaimana Anda menjangkaunya (Python SDK, oloproof.yaml dan CLI, atau browser), dan apa yang belum dibangun. Halaman ini diambil dari audit kapabilitas 8 Oktober 2026, sebuah tinjauan internal yang memeriksa setiap baris terhadap kode dan pengujiannya, bukan terhadap rencana.

Cara membaca halaman ini

"SDK" berarti paket Python (import oloproof). "YAML" berarti proyek yang Anda jalankan dengan oloproof run dari oloproof.yaml. Keduanya bukan permukaan yang sama: beberapa evaluator hanya ada di salah satunya, dan halaman ini menyebutkan yang mana. "Browser" berarti workbench yang di-hosting, yang menampilkan apa yang Anda kirim dengan oloproof push; workbench tidak menjalankan evaluasi yang belum Anda definisikan dalam kode atau YAML.

Oloproof memanggil sistem Anda; Oloproof tidak meng-hosting, mengisolasi, atau mengatur ulang sistem itu. Aplikasi Anda mengelola state, sesi, dan efek samping tool-nya sendiri selama run.

Menurut jenis sistem

Sistem AndaApa yang berfungsiDi manaBelum dibangun
Classifier atau keluaran terstrukturKecocokan persis, contains, regex, skema JSON, juri rubrik, juri probabilitas, classifier model; tingkat kelulusan dengan intervalSDK dan YAML; model_classifier, probability_judge dan cascade hanya di YAMLn/a
Pembuatan teks, ringkasan, ekstraksiPemeriksaan yang sama atas teks bebas, juri rubrik, kesepakatan juri dengan label manusia, preferensi berpasanganSDK dan YAML; preferensi adalah perintah oloproof preferBLEU, ROUGE, atau kemiripan embedding (tulis sendiri dengan @evaluator)
RAG yang Anda jalankan sebagai kotak hitamHit rate, recall, MRR, nDCG, validitas sitasi, juri groundedness dan dukungan sitasi, dari artefak retrieval yang direkam atau dikembalikan sistem AndaSDK dan YAMLDiagnosis: diagnose memerlukan sistem bertahap
RAG yang dibangun bertahapSemua di atas, caching per tahap, dan oloproof diagnose dengan konteks emas, perubahan top-k atau reranker di samping kontrolSDK @rag_system, YAML system.rag, CLI diagnoseIntervensi di luar ketiganya
Agen yang memakai toolBatas langkah, tool wajib dan terlarang, urutan tool, loop, batasan, dari trajektori yang direkamSDK dan YAMLPemeriksaan kualitas trajektori yang dinilai LLM
Sistem multi-agenRouting, izin tool per agen, batas handoffSDK dan YAMLn/a
Replay agenMenjalankan ulang kasus dari checkpoint untuk melabeli sebuah langkah sebagai perlu atau tidakHanya SDK (replay_case), untuk sistem yang mendukung checkpointPerintah CLI
Model classifier binerAkurasi, presisi, recall, Brier, log loss, peringkat (AUC)SDK dan YAML predictive:n/a
Model multikelasSatu blok per kelas (satu melawan sisanya)SDK dan YAMLRata-rata makro atau mikro
Model regresiGalat absolut dalam target_range yang dideklarasikanSDK dan YAMLGalat kuadrat, R kuadrat, galat tak terbatas
Percakapan multi-giliranApakah setiap giliran yang diskenariokan dijawab, dan juri rubrik atas seluruh percakapanHanya SDK (ConversationCompleted, ConversationJudge)Tipe YAML, skor per giliran, simulator pengguna, replay percakapan
Gambar, audio, videoTidak ada yang native: kasus dapat membawa URL atau file terenkode melalui sistem Anda, dan @evaluator dapat memeriksa keluarannyan/aJuri hanya melihat teks JSON; tanpa artefak media atau rendering

Solusi sementara untuk multi-giliran: jadikan setiap giliran sebuah kasus dan beri giliran-giliran dari satu percakapan group_id yang sama, sehingga analisis memperlakukannya sebagai klaster (Klaster). Setiap giliran kemudian menjadi panggilan terpisah, bukan satu dialog yang direkam.

Menghubungkan sistem Anda

  • Callable Python: @system di SDK atau system.callable: module:function di YAML. Callable ini menerima input kasus dan mengembalikan dictionary. Fungsi sinkron dan asinkron sama-sama berfungsi.
  • HTTP: system.http dengan url, method, output_path, artifacts dan timeout_s. Input kasus dikirim sebagai body JSON dan responsnya dibaca sebagai JSON. Header dan autentikasi belum dapat dikonfigurasi; letakkan endpoint yang memerlukan key di balik callable yang menambahkannya.
  • Evaluator kustom: @evaluator di SDK. oloproof.yaml belum dapat menamai satu pun.

Alur kerja

Alur kerjaApa yang berfungsiBelum dibangun
Membandingkan dua versiSuperioritas berpasangan, non-inferioritas dan ekuivalensi; slice dengan kontrol multiplisitasn/a
CIKode keluar oloproof gate dari block_on kebijakan Anda, sign-off, catatan bertanda tangan; ringkasan pull request (--summary markdown)n/a
Tinjauan manusiaLabel dari file atau terminal; antrean tinjauan di browser dengan peninjau yang ditugaskan pada workspace yang di-hostingAntrean tinjauan di browser pada proyek lokal
Workbench browserRun, kasus, perbandingan, diagnostik, evaluator, tinjauan dan traffic, setelah oloproof pushImpor dataset, penyusunan juri, jadwal, peringatan dan postmortem (ditampilkan sebagai rencana)
Browser lokaln/aTidak ada perintah CLI yang menyajikan workbench secara lokal; workbench di-hosting

Apa yang telah diuji, dan bagaimana

Setiap keluarga di atas memiliki pengujian otomatis, dijalankan pada fixture dan provider tiruan. Run terhadap sistem nyata dengan model nyata direkam untuk RAG, satu agen, dan satu percakapan multi-giliran; belum ada untuk model prediktif atau sistem multi-agen. Metode statistik yang memutuskan rilis masing-masing disetujui oleh auditnya sendiri; metrik tanpa interval yang disetujui tidak memutuskan aturan berdasarkan interval, dan aturan yang memerlukannya mengembalikan MANUAL_REVIEW atau INSUFFICIENT_EVIDENCE beserta alasannya.