跳到主要内容

指南

目前可用的功能

你今天可以用 Oloproof 评估什么、如何使用它(Python SDK、oloproof.yaml 和 CLI,或浏览器),以及哪些尚未构建。本页依据 2026 年 10 月 8 日的能力审计,这是一次内部审查,它对照代码及其测试而非计划逐行核查。

如何阅读本页

"SDK" 指 Python 包(import oloproof)。"YAML" 指你通过 oloproof run 从 oloproof.yaml 运行的项目。两者并不是同一个入口:少数评估器只存在于其中之一,本页会说明是哪一个。"浏览器" 指托管的工作台,它展示你通过 oloproof push 推送的内容;它不会运行你没有在代码或 YAML 中定义的评估。

Oloproof 调用你的系统;它不托管、不隔离、也不重置你的系统。运行期间,你的应用自行负责其状态、会话和工具副作用。

按系统类型

你的系统可用功能位置尚未构建
分类器或结构化输出精确匹配、包含、正则、JSON schema、评分细则评判模型、概率评判模型、模型分类器;附区间的通过率SDK 和 YAML;model_classifier、probability_judge 和 cascade 仅在 YAML 中n/a
文本生成、摘要、抽取对自由文本的同样检查、评分细则评判模型、评判模型与人工标签的一致性、成对偏好SDK 和 YAML;偏好即 oloproof prefer 命令BLEU、ROUGE 或嵌入相似度(用 @evaluator 自行编写)
作为黑盒运行的 RAG命中率、召回率、MRR、nDCG、引用有效性、有据性与引用支持评判模型,基于你的系统记录或返回的检索执行产物SDK 和 YAML诊断:diagnose 需要分阶段的系统
分阶段构建的 RAG以上全部、按阶段缓存,以及 oloproof diagnose:在对照组旁使用标准上下文、top-k 或重排序器变更SDK @rag_system、YAML system.rag、CLI diagnose这三种之外的干预
使用工具的智能体步数限制、必需与禁止的工具、工具顺序、循环、约束,基于记录的轨迹SDK 和 YAML由 LLM 评判的轨迹质量检查
多智能体系统路由、每个智能体的工具权限、交接次数限制SDK 和 YAMLn/a
智能体重放从检查点重新运行一个用例,将某一步标注为必要或不必要仅 SDK(replay_case),适用于支持检查点的系统CLI 命令
二分类模型准确率、精确率、召回率、Brier、对数损失、排序(AUC)SDK 和 YAML predictive:n/a
多分类模型每个类别一个区块(一对其余)SDK 和 YAML宏平均或微平均
回归模型声明的 target_range 内的绝对误差SDK 和 YAML平方误差、R 平方、无界误差
多轮对话每个脚本化轮次是否得到回答,以及对整段对话的评分细则评判模型仅 SDK(ConversationCompleted、ConversationJudge)YAML 类型、轮次级评分、用户模拟器、对话重放
图像、音频、视频没有原生支持:用例可以通过你的系统携带 URL 或编码文件,@evaluator 可以检查输出n/a评判模型只能看到 JSON 文本;没有媒体执行产物或渲染

多轮对话的一种变通办法:把每一轮作为一个用例,并给同一段对话的各轮相同的 group_id,让分析把它们视为一个聚类(聚类)。这样每一轮都是一次单独的调用,而不是一段记录下来的对话。

连接你的系统

  • Python 可调用对象:SDK 中的 @system,或 YAML 中的 system.callable: module:function。它接收用例的 input 并返回一个字典。同步和异步函数都可以。
  • HTTP:system.http,带 url、method、output_path、artifacts 和 timeout_s。用例输入作为 JSON 请求体发送,响应按 JSON 读取。请求头和身份验证目前还不能配置;请把需要密钥的端点放在一个会添加密钥的可调用对象之后。
  • 自定义评估器:SDK 中的 @evaluator。oloproof.yaml 目前还不能指定它。

工作流

工作流可用功能尚未构建
比较两个版本配对优效、非劣效和等效;带多重性控制的切片n/a
CI依据策略 block_on 的 oloproof gate 退出码、签署、签名记录;拉取请求摘要(--summary markdown)n/a
人工评审来自文件或终端的标签;托管工作区上带指定评审人的浏览器评审队列本地项目上的浏览器评审队列
浏览器工作台oloproof push 之后的运行、用例、比较、诊断、评估器、评审和流量数据集导入、评判模型编写、计划任务、告警和事后复盘(显示为计划中)
本地浏览器n/a没有在本地提供工作台的 CLI 命令;工作台是托管的

测试了什么,如何测试

以上每一类都有自动化测试,在固定数据和模拟的提供方上运行。针对真实系统、使用真实模型的运行已为 RAG、单个智能体和一段多轮对话记录在案;预测模型和多智能体系统还没有。决定发布的统计方法各自经过其审计才被认可;没有已认可区间的指标不会依据区间对规则做出决策,需要区间的规则会返回 MANUAL_REVIEW 或 INSUFFICIENT_EVIDENCE,并附上原因。