Skip to content

Log perubahan

Apa yang dirilis, dan apa artinya bagi keputusan rilis.

  1. SDK

    Oloproof kini ada di PyPI

    oloproof 0.1.0a1 telah diterbitkan, sehingga jalur emas dimulai dengan pip install oloproof di lingkungan yang bersih dan langsung berlanjut ke oloproof init dan oloproof run. Rilis dibangun dan diterbitkan dari commit bertag di CI, melalui trusted publishing PyPI, tanpa token yang disimpan.

  2. Workbench

    Putar ulang bagaimana sebuah eksekusi mencapai keputusannya

    Eksekusi atau perbandingan yang berhenti lebih awal kini mencatat setiap tinjauan yang dilakukannya, dan workbench memutarnya ulang: interval anytime-valid yang menyempit di setiap tinjauan terhadap ambang batas yang tidak bergerak, serta tinjauan saat setiap aturan memutuskan. Workbench hanya menggambar interval yang dicatat oleh engine. Interval sampel tetap tidak pernah dianimasikan seolah-olah langsung, karena mengamatinya sampai terlihat bagus akan membatalkan jaminannya.

  3. Workbench

    Palet perintah, navigasi keyboard, dan rantai bukti

    ⌘K atau Ctrl+K menampilkan setiap tujuan yang dapat Anda lihat, dan ID eksekusi atau digest perbandingan yang ditempelkan akan langsung membukanya. g lalu sebuah huruf untuk bernavigasi, j dan k untuk berpindah antarbaris tabel, dan ? menampilkan semua pintasan. Sebuah kasus terbuka di samping eksekusinya, dengan rantai buktinya dan orang-orang yang memberinya label. Semua animasi berhenti saat gerakan dikurangi.

  4. Hosting

    Workbench yang di-hosting di oloproof.com

    Workbench kini melayani oloproof.com, dan jalur emas end-to-end lolos di host: seorang reviewer memberi label pada 80 kasus yang ditarik ruang kerja, menemukan 7 jawaban salah yang diloloskan juri, dan ruang kerja memutuskan Lulus pada sampel terverifikasinya (91,2%, interval 74,5% hingga 100,0%) di mana eksekusi yang di-push saja tidak memiliki cukup bukti. Akses hanya melalui undangan.

  5. Trace

    Trace OpenTelemetry ke oloproof collect

    oloproof collect menerima OTLP/HTTP dari SDK OpenTelemetry standar, merangkai span GenAI dan OpenInference menjadi trace beralamat konten, dan menyimpan kontennya di mesin Anda; push mengikuti kebijakan egress Anda. oloproof traces promote mengubah trace menjadi kasus uji beserta provenansnya, dan menolak duplikat.

  6. Trace

    Keputusan atas sampel lalu lintas produksi

    Kolektor Anda menandatangani komitmen atas setiap trace yang disegelnya tiap jam. Ruang kerja lalu menarik sampel dengan keacakannya sendiri dan memeriksa setiap trace yang ditarik terhadap komitmen tersebut, sehingga sampel tidak bisa dikurasi dengan menahan trace. oloproof traces evaluate menilai sampel berdasarkan output yang tercatat, ruang kerja memutuskannya di bawah evaluasi yang dipatok oleh Owner, dan sebuah confidence sequence mengikuti setiap metrik lintas sampel di halaman Production proyek.

  7. Tinjauan

    Antrean tinjauan di browser

    Owner atau Admin membuka antrean dan menugaskan reviewer, yang memberi label dari keyboard: lolos atau gagal, skor pada skala yang dideklarasikan, atau preferensi buta antara dua eksekusi, masing-masing dicatat per akun. Browser reviewer mengambil konten kasus dari oloproof collect di sisi Anda dengan tiket bertanda tangan berlaku lima menit, sehingga ruang kerja tidak pernah menyimpannya.

  8. Gerbang

    Eksekusi terverifikasi

    Sebuah eksekusi dapat ditandatangani oleh kunci runner yang didaftarkan Owner, atau oleh worker terkelola. Owner mematok seluruh evaluasi (suite, evaluator, metrik, dan eksekusi baseline) beserta kebijakan gerbangnya, dan ruang kerja memutuskan setiap versi sistem pada eksekusi pertamanya atas evaluasi yang persis sama itu, dibandingkan dengan eksekusi yang dipatok. Label manusia hanya dihitung dari pemberi label yang independen, dihitung per akun.

  9. Juri

    Sampel manusia yang ditarik ruang kerja

    Interval PPI mengoreksi juri dengan sampel acak label manusia, dan jaminannya membutuhkan sampel yang tidak dipilih siapa pun. Ruang kerja kini menarik sampel itu setelah bukti eksekusi dibekukan di sana, merahasiakan seed-nya, dan memeriksa interval terkoreksi dengan engine-nya sendiri. Halaman eksekusi menyatakan apakah ruang kerja telah memverifikasi sebuah interval; sampel yang ditarik di mesin Anda sendiri tetap ditandai sebagai itikad baik.

  10. Evaluasi

    Penghentian dini, dan tingkat juri yang dikoreksi oleh manusia

    Kebijakan dengan early_stopping: true menjalankan kasus dalam batch ber-seed dan menghentikan sebuah eksekusi, atau kandidat beserta baseline-nya secara serempak, begitu setiap aturan telah memutuskan, dicatat sebagai DECIDED_EARLY bersama kasus yang tidak diperlukannya. Tingkat yang dihentikan memakai interval taruhan anytime-valid, sehingga meninjau setelah setiap batch tetap menjaga jaminannya. Tingkat lolos juri dapat digerbangi dengan interval PPI yang menggabungkan juri dengan sampel acak buta label manusia, ditampilkan di samping interval khusus juri dan khusus manusia.

  11. Email

    Notifikasi lewat email

    Empat notifikasi, masing-masing kategori yang dapat dimatikan anggota langsung dari email itu: pekerjaan terkelola selesai atau gagal, eksekusi atau perbandingan yang di-push dan gerbangnya memblokir rilis, penggunaan pada 80% dan 100% dari kuota gratis, serta anggota baru bergabung. Email gerbang mengutip keputusan yang tersimpan dan menautkan ke eksekusi, tanpa konten kasus. Hanya email: tidak ada Slack, pager, atau webhook.

  12. Akun

    Kata sandi, dan menghapus akun Anda

    Masuk dengan alamat email dan kata sandi selain dengan penyedia, dengan alamat terverifikasi dan pengaturan ulang. Seseorang dapat menghapus akunnya sendiri: pengguna itu dan setiap ruang kerja yang hanya beranggotakan dirinya terhapus sekaligus, dan worker membersihkan bukti ruang kerja tersebut.

  13. Juri

    Juri probabilitas, kalibrasi, dan kaskade

    Juri dapat menjawab pertanyaan bertipe (ya atau tidak, sebuah pilihan, skor terhadap tingkatan) dengan probabilitas untuk setiap jawaban, dibaca dari probabilitas token model lokal dalam satu forward pass. Kalibrasinya diukur terhadap label manusia dan dicatat pada entri registry-nya, dan kaskade hanya mengirim kasus yang membuat juri murah ragu ke juri yang lebih kuat. Klasifikator terlatih juga dapat menjadi evaluator, tanpa kunci dan tanpa jaringan.

  14. Juri

    Juri yang diuji terhadap label manusia

    Beri label pada kasus sebuah eksekusi dari file atau terminal, dan uji draf juri terhadap label tersebut sebelum mengadopsinya. Juri melaporkan biasnya di samping tingkat kesepakatannya, juri yang biasnya melebihi margin yang dideklarasikan dilarang menjadi gerbang, dan sebuah validasi tidak lagi berlaku begitu model yang diukurnya berubah. Probe tanpa label memeriksa apakah sebuah putusan bergeser ketika tidak ada hal penting yang berubah, dan perbandingan berpasangan ditanyakan dalam kedua urutan, sehingga jawaban yang disukai hanya karena posisinya akan terlihat tanpa ada yang memberi label.

  15. Agen

    Bukti multi-agen

    Trajektori mencatat agen mana yang mengambil setiap langkah, dan setiap serah terima. Evaluator menilai perutean (apakah permintaan sampai ke agen yang semestinya menanganinya), izin alat (apakah ada agen yang memanggil alat yang bukan haknya) dan agen yang saling mengoper kendali alih-alih menyelesaikan tugas, dan slice mengelompokkan kasus berdasarkan rute.

  16. Evaluasi

    Replikasi dan hitungan kasus tidak stabil

    Sebuah suite dapat mengukur setiap kasus beberapa kali. Replikasi diagregasi per kasus sebelum interval apa pun, perbandingan memasangkannya sebagai pecahan, dan eksekusi melaporkan berapa banyak kasus yang tidak konsisten dengan dirinya sendiri. Sebuah sistem dapat menandai kegagalan sebagai sementara agar runner mencobanya lagi: pada sistem RAG yang berjalan sungguhan, hal itu memulihkan 18 dari 22 kasus yang hilang dan mempersempit interval sebesar 39%.