指南
从这里开始
Oloproof 做什么、何时该用、何时不该用,以及阅读这些指南的顺序:从对一个应用的第一次评估,到比较版本、审核、CI 和精确的契约。
Oloproof 做什么
Oloproof 在一组固定的用例上运行你的 AI 应用,用你选择的评估器检查每个输出,并把结果转化为带区间的比率。随后,你编写的发布策略把每条规则判定为 PASS、FAIL、INSUFFICIENT_EVIDENCE 或 MANUAL_REVIEW,命令以该决策作为退出码,CI 便可以使用它。一切都在你的机器上运行;除非你把一次运行推送到托管工作区,否则任何数据都不会离开它。这些术语在核心概念中有定义。
当你需要知道一个应用在你信任的用例上是否达到了既定标准、这个回答有多可靠、以及一次变更让它变好还是变差时,就用它。Oloproof 调用你的系统;它不托管、不隔离也不重置你的系统,你的应用自己负责其状态、会话和工具副作用。关于针对每类系统哪些已经构建、哪些尚未构建,请在投入使用之前阅读目前可用的功能。
这些指南描述的是 Oloproof 0.1.0a5。pip show oloproof 会打印你已安装的版本;较旧的版本可能缺少这里展示的某个命令或标志,例如 oloproof init --example,而 pip install --upgrade --pre oloproof 会把它更新到最新。
使用路线
| 步骤 | 你要做的事 | 阅读 |
|---|---|---|
| 1 | 了解 Oloproof 做什么以及何时使用 | 本页、核心概念、目前可用的功能 |
| 2 | 评估你的第一个应用,不需要基线 | 快速入门 |
| 3 | 为你的系统类型选择一份指南 | 下面的表格 |
| 4 | 查看失败并理解结果 | 测试套件、错误、聚类用例、切片 |
| 5 | 修改系统并比较版本 | 比较、比较规则 |
| 6 | 加入人工审核、协作和 CI | 评判器、门禁、CI、通知 |
| 7 | 查阅精确的技术契约 | 配置、SDK 参考、结果、CLI |
第一次评估不需要基线:它问的是你的应用的一个版本是否满足你的要求。比较两个版本是第 5 步的事,等你有了一次值得拿来比较的运行之后。
选择你的系统类型
| 你的系统 | 从这里开始 |
|---|---|
| 分类器、路由器或结构化输出(一个标签、一个 JSON 对象) | 分类 |
| 自由文本:回答、摘要、信息抽取 | 文本生成 |
| 通过 HTTP 访问的服务,任何语言均可 | HTTP 端点 |
| 检索增强生成 | RAG |
| 使用工具的智能体,或多个智能体 | 智能体 |
| 训练好的预测模型(分类或回归) | 预测模型 |
| 多轮对话 | 对话 |
图像、音频和视频没有原生支持:用例可以通过你的系统携带一个 URL 或编码后的文件,自定义评估器可以检查输出,但评判模型只能看到 JSON 文本。