跳至主要內容

指南

目前可用的功能

您今天可以用 Oloproof 評估什麼、如何使用它(Python SDK、oloproof.yaml 與 CLI,或瀏覽器),以及哪些尚未建置。本頁依據 2026 年 10 月 8 日的能力稽核,這是一次內部審查,它是對照程式碼及其測試而非計畫逐行查核。

如何閱讀本頁

「SDK」指 Python 套件(import oloproof)。「YAML」指您以 oloproof run 從 oloproof.yaml 執行的專案。兩者並不是同一個介面:少數評估器只存在於其中之一,本頁會說明是哪一個。「瀏覽器」指託管的工作台,它顯示您以 oloproof push 推送的內容;它不會執行您未在程式碼或 YAML 中定義的評估。

Oloproof 呼叫您的系統;它不託管、不隔離,也不重設您的系統。執行期間,您的應用程式自行負責其狀態、工作階段與工具的副作用。

依系統類型

您的系統可用功能位置尚未建置
分類器或結構化輸出完全相符、包含、正規表示式、JSON schema、評分準則評審、機率評審、模型分類器;附區間的通過率SDK 與 YAML;model_classifier、probability_judge 與 cascade 僅在 YAML 中n/a
文字生成、摘要、擷取對自由文字的同樣檢查、評分準則評審、評審與人工標籤的一致性、成對偏好SDK 與 YAML;偏好即 oloproof prefer 指令BLEU、ROUGE 或嵌入相似度(以 @evaluator 自行撰寫)
以黑箱方式執行的 RAG命中率、召回率、MRR、nDCG、引用有效性、有據性與引用支持評審,依據您的系統記錄或回傳的檢索執行產物SDK 與 YAML診斷:diagnose 需要分階段的系統
分階段建置的 RAG以上全部、依階段快取,以及 oloproof diagnose:在對照組旁使用標準脈絡、top-k 或重新排序器變更SDK @rag_system、YAML system.rag、CLI diagnose這三種以外的介入
使用工具的代理步數限制、必要與禁止的工具、工具順序、迴圈、限制條件,依據記錄的軌跡SDK 與 YAML由 LLM 評判的軌跡品質檢查
多代理系統路由、每個代理的工具權限、交接次數限制SDK 與 YAMLn/a
代理重播從檢查點重新執行一個案例,將某一步標記為必要或不必要僅 SDK(replay_case),適用於支援檢查點的系統CLI 指令
二元分類模型正確率、精確率、召回率、Brier、對數損失、排序(AUC)SDK 與 YAML predictive:n/a
多類別模型每個類別一個區塊(一對其餘)SDK 與 YAML巨觀或微觀平均
迴歸模型宣告的 target_range 內的絕對誤差SDK 與 YAML平方誤差、R 平方、無界誤差
多輪對話每個腳本化輪次是否得到回答,以及對整段對話的評分準則評審僅 SDK(ConversationCompleted、ConversationJudge)YAML 類型、輪次層級分數、使用者模擬器、對話重播
圖片、音訊、影片沒有原生支援:案例可以透過您的系統攜帶 URL 或編碼檔案,@evaluator 可以檢查輸出n/a評審只看得到 JSON 文字;沒有媒體執行產物或呈現

多輪對話的一種變通方式:把每一輪當成一個案例,並給同一段對話的各輪相同的 group_id,讓分析把它們視為一個叢集(叢集)。如此每一輪都是一次獨立的呼叫,而不是一段記錄下來的對話。

連接您的系統

  • Python 可呼叫物件:SDK 中的 @system,或 YAML 中的 system.callable: module:function。它接收案例的 input 並回傳一個字典。同步與非同步函式皆可。
  • HTTP:system.http,搭配 url、method、output_path、artifacts 與 timeout_s。案例輸入以 JSON 主體送出,回應以 JSON 讀取。標頭與驗證目前還無法設定;請把需要金鑰的端點放在一個會加上金鑰的可呼叫物件之後。
  • 自訂評估器:SDK 中的 @evaluator。oloproof.yaml 目前還不能指定它。

工作流程

工作流程可用功能尚未建置
比較兩個版本配對優效、不劣性與等效性;具多重比較控制的切片n/a
CI依政策 block_on 的 oloproof gate 結束代碼、簽核、簽章紀錄;拉取請求摘要(--summary markdown)n/a
人工審查來自檔案或終端機的標籤;託管工作區上具指派審查者的瀏覽器審查佇列本機專案上的瀏覽器審查佇列
瀏覽器工作台oloproof push 之後的執行、案例、比較、診斷、評估器、審查與流量資料集匯入、評審撰寫、排程、警示與事後檢討(顯示為規劃中)
本機瀏覽器n/a沒有在本機提供工作台的 CLI 命令;工作台為託管

測試了什麼,以及如何測試

以上每一類都有自動化測試,在固定資料與模擬的供應者上執行。針對真實系統、使用真實模型的執行已為 RAG、單一代理與一段多輪對話記錄在案;預測模型與多代理系統則尚未有。決定發布的統計方法各自經其稽核才被認可;沒有已認可區間的指標不會依區間對規則做出判定,而需要區間的規則會回傳 MANUAL_REVIEW 或 INSUFFICIENT_EVIDENCE 並附上原因。