对比
Oloproof 与临时性提示词测试的对比。
在 playground 中抽查既快又确实有用,适合探索阶段。一旦变更交付给用户,它就不够用了。
| 问题 | Playground 抽查 | Oloproof |
|---|---|---|
| 质量变了吗? | 看了几条输出后的感觉 | 基于配对用例的差值及其 95% 区间,并依据该区间作出决定 |
| 对谁发生了变化? | 未知 | 按声明的切片:语言、意图或任意元数据键、智能体调用的第一个工具、它的路由 |
| 下个季度还能重新运行吗? | 不能:提示词和用例都已不在了 | 能:测试套件、系统版本和评估器版本都按内容寻址,样本会保留其随机种子 |
| 它能拦下一次糟糕的发布吗? | 只有在有人记得去看的时候 | 门控以非零状态退出,CI 任务失败:规则失败时为 1,证据无法判定时为 3 |
| 你拿什么给风险部门或客户看? | 讨论串里的截图 | 一个导出的数据包:运行本身及其测试套件、系统、评估器、用例和签核 |
| 得到第一个信号所需的时间 | 几分钟 | 本地几分钟,之后在你的 CI 运行它的每一次变更上 |
抽查仍然更胜一筹的场合
早期探索、调试某一条奇怪的输出,以及编写提示词时的基本检查。继续这样做。当行为重要到需要为之辩护时,就该建立评估测试套件了。