Skip to content

对比

Oloproof 与临时性提示词测试的对比。

在 playground 中抽查既快又确实有用,适合探索阶段。一旦变更交付给用户,它就不够用了。

团队针对一次变更会提出的问题,分别由 playground 抽查和 Oloproof 来回答
问题Playground 抽查Oloproof
质量变了吗?看了几条输出后的感觉基于配对用例的差值及其 95% 区间,并依据该区间作出决定
对谁发生了变化?未知按声明的切片:语言、意图或任意元数据键、智能体调用的第一个工具、它的路由
下个季度还能重新运行吗?不能:提示词和用例都已不在了能:测试套件、系统版本和评估器版本都按内容寻址,样本会保留其随机种子
它能拦下一次糟糕的发布吗?只有在有人记得去看的时候门控以非零状态退出,CI 任务失败:规则失败时为 1,证据无法判定时为 3
你拿什么给风险部门或客户看?讨论串里的截图一个导出的数据包:运行本身及其测试套件、系统、评估器、用例和签核
得到第一个信号所需的时间几分钟本地几分钟,之后在你的 CI 运行它的每一次变更上

抽查仍然更胜一筹的场合

早期探索、调试某一条奇怪的输出,以及编写提示词时的基本检查。继续这样做。当行为重要到需要为之辩护时,就该建立评估测试套件了。