跳到主要内容

指南

从这里开始

Oloproof 做什么、何时该用、何时不该用,以及阅读这些指南的顺序:从对一个应用的第一次评估,到比较版本、审核、CI 和精确的契约。

Oloproof 做什么

Oloproof 在一组固定的用例上运行你的 AI 应用,用你选择的评估器检查每个输出,并把结果转化为带区间的比率。随后,你编写的发布策略把每条规则判定为 PASS、FAIL、INSUFFICIENT_EVIDENCE 或 MANUAL_REVIEW,命令以该决策作为退出码,CI 便可以使用它。一切都在你的机器上运行;除非你把一次运行推送到托管工作区,否则任何数据都不会离开它。这些术语在核心概念中有定义。

当你需要知道一个应用在你信任的用例上是否达到了既定标准、这个回答有多可靠、以及一次变更让它变好还是变差时,就用它。Oloproof 调用你的系统;它不托管、不隔离也不重置你的系统,你的应用自己负责其状态、会话和工具副作用。关于针对每类系统哪些已经构建、哪些尚未构建,请在投入使用之前阅读目前可用的功能。

这些指南描述的是 Oloproof 0.1.0a5。pip show oloproof 会打印你已安装的版本;较旧的版本可能缺少这里展示的某个命令或标志,例如 oloproof init --example,而 pip install --upgrade --pre oloproof 会把它更新到最新。

使用路线

步骤你要做的事阅读
1了解 Oloproof 做什么以及何时使用本页、核心概念、目前可用的功能
2评估你的第一个应用,不需要基线快速入门
3为你的系统类型选择一份指南下面的表格
4查看失败并理解结果测试套件、错误、聚类用例、切片
5修改系统并比较版本比较、比较规则
6加入人工审核、协作和 CI评判器、门禁、CI、通知
7查阅精确的技术契约配置、SDK 参考、结果、CLI

第一次评估不需要基线:它问的是你的应用的一个版本是否满足你的要求。比较两个版本是第 5 步的事,等你有了一次值得拿来比较的运行之后。

选择你的系统类型

你的系统从这里开始
分类器、路由器或结构化输出(一个标签、一个 JSON 对象)分类
自由文本:回答、摘要、信息抽取文本生成
通过 HTTP 访问的服务,任何语言均可HTTP 端点
检索增强生成RAG
使用工具的智能体,或多个智能体智能体
训练好的预测模型(分类或回归)预测模型
多轮对话对话

图像、音频和视频没有原生支持:用例可以通过你的系统携带一个 URL 或编码后的文件,自定义评估器可以检查输出,但评判模型只能看到 JSON 文本。