指南
目前可用的功能
你今天可以用 Oloproof 评估什么、如何使用它(Python SDK、oloproof.yaml 和 CLI,或浏览器),以及哪些尚未构建。本页依据 2026 年 10 月 8 日的能力审计,这是一次内部审查,它对照代码及其测试而非计划逐行核查。
如何阅读本页
"SDK" 指 Python 包(import oloproof)。"YAML" 指你通过 oloproof run 从 oloproof.yaml 运行的项目。两者并不是同一个入口:少数评估器只存在于其中之一,本页会说明是哪一个。"浏览器" 指托管的工作台,它展示你通过 oloproof push 推送的内容;它不会运行你没有在代码或 YAML 中定义的评估。
Oloproof 调用你的系统;它不托管、不隔离、也不重置你的系统。运行期间,你的应用自行负责其状态、会话和工具副作用。
按系统类型
| 你的系统 | 可用功能 | 位置 | 尚未构建 |
|---|---|---|---|
| 分类器或结构化输出 | 精确匹配、包含、正则、JSON schema、评分细则评判模型、概率评判模型、模型分类器;附区间的通过率 | SDK 和 YAML;model_classifier、probability_judge 和 cascade 仅在 YAML 中 | n/a |
| 文本生成、摘要、抽取 | 对自由文本的同样检查、评分细则评判模型、评判模型与人工标签的一致性、成对偏好 | SDK 和 YAML;偏好即 oloproof prefer 命令 | BLEU、ROUGE 或嵌入相似度(用 @evaluator 自行编写) |
| 作为黑盒运行的 RAG | 命中率、召回率、MRR、nDCG、引用有效性、有据性与引用支持评判模型,基于你的系统记录或返回的检索执行产物 | SDK 和 YAML | 诊断:diagnose 需要分阶段的系统 |
| 分阶段构建的 RAG | 以上全部、按阶段缓存,以及 oloproof diagnose:在对照组旁使用标准上下文、top-k 或重排序器变更 | SDK @rag_system、YAML system.rag、CLI diagnose | 这三种之外的干预 |
| 使用工具的智能体 | 步数限制、必需与禁止的工具、工具顺序、循环、约束,基于记录的轨迹 | SDK 和 YAML | 由 LLM 评判的轨迹质量检查 |
| 多智能体系统 | 路由、每个智能体的工具权限、交接次数限制 | SDK 和 YAML | n/a |
| 智能体重放 | 从检查点重新运行一个用例,将某一步标注为必要或不必要 | 仅 SDK(replay_case),适用于支持检查点的系统 | CLI 命令 |
| 二分类模型 | 准确率、精确率、召回率、Brier、对数损失、排序(AUC) | SDK 和 YAML predictive: | n/a |
| 多分类模型 | 每个类别一个区块(一对其余) | SDK 和 YAML | 宏平均或微平均 |
| 回归模型 | 声明的 target_range 内的绝对误差 | SDK 和 YAML | 平方误差、R 平方、无界误差 |
| 多轮对话 | 每个脚本化轮次是否得到回答,以及对整段对话的评分细则评判模型 | 仅 SDK(ConversationCompleted、ConversationJudge) | YAML 类型、轮次级评分、用户模拟器、对话重放 |
| 图像、音频、视频 | 没有原生支持:用例可以通过你的系统携带 URL 或编码文件,@evaluator 可以检查输出 | n/a | 评判模型只能看到 JSON 文本;没有媒体执行产物或渲染 |
多轮对话的一种变通办法:把每一轮作为一个用例,并给同一段对话的各轮相同的 group_id,让分析把它们视为一个聚类(聚类)。这样每一轮都是一次单独的调用,而不是一段记录下来的对话。
连接你的系统
- Python 可调用对象:SDK 中的 @system,或 YAML 中的 system.callable: module:function。它接收用例的 input 并返回一个字典。同步和异步函数都可以。
- HTTP:system.http,带 url、method、output_path、artifacts 和 timeout_s。用例输入作为 JSON 请求体发送,响应按 JSON 读取。请求头和身份验证目前还不能配置;请把需要密钥的端点放在一个会添加密钥的可调用对象之后。
- 自定义评估器:SDK 中的 @evaluator。oloproof.yaml 目前还不能指定它。
工作流
| 工作流 | 可用功能 | 尚未构建 |
|---|---|---|
| 比较两个版本 | 配对优效、非劣效和等效;带多重性控制的切片 | n/a |
| CI | 依据策略 block_on 的 oloproof gate 退出码、签署、签名记录;拉取请求摘要(--summary markdown) | n/a |
| 人工评审 | 来自文件或终端的标签;托管工作区上带指定评审人的浏览器评审队列 | 本地项目上的浏览器评审队列 |
| 浏览器工作台 | oloproof push 之后的运行、用例、比较、诊断、评估器、评审和流量 | 数据集导入、评判模型编写、计划任务、告警和事后复盘(显示为计划中) |
| 本地浏览器 | n/a | 没有在本地提供工作台的 CLI 命令;工作台是托管的 |
测试了什么,如何测试
以上每一类都有自动化测试,在固定数据和模拟的提供方上运行。针对真实系统、使用真实模型的运行已为 RAG、单个智能体和一段多轮对话记录在案;预测模型和多智能体系统还没有。决定发布的统计方法各自经过其审计才被认可;没有已认可区间的指标不会依据区间对规则做出决策,需要区间的规则会返回 MANUAL_REVIEW 或 INSUFFICIENT_EVIDENCE,并附上原因。