Skip to content

关于

我们构建测量层。

团队每周都在向 AI 系统发布变更,却无法说清上一次变更是否让系统变得更好。Oloproof 是技术栈中用证据回答这个问题的那一部分:一个估计值、它的不确定性,以及一个你可以核查的决定。

我们如何决定

依据区间,而不是估计值

当整个区间都越过阈值时,规则通过;当整个区间都未达到阈值时,规则不通过。介于两者之间的情况一律报告为证据不足,绝不会被四舍五入成通过。

我们声明什么

不声明任何无法复现的东西

一种统计方法要进入产品,必须附有书面说明、覆盖率网格和一次审计。在此之前,需要该方法的规则会以失败告终,而不是借用它。

证据存放在哪里

默认在你这里

本地运行从不离开你的机器。一次推送携带指标、区间和决定;除非你的项目另有设置,原始输入、输出和追踪都留在本地。

评判器

先经过测量,再把关

LLM 评判器在可以决定发布之前,要先对照人工标注进行检验,看的是其一致性的下界。

语言模型

在证据之上,而不是在证据之中

模型可以评判、解释并建议下一个实验。它们绝不会自创统计方法,也不会作出发布决定。

成本

同样的证据绝不付两次钱

每一次执行和评判都按其内容只存储一次。再次运行未改动的测试套件时,会复用已有的结果。

它的用途

它有效吗? 针对你声明的场景和标准,并写明分母。

它在哪里失败? 包括被整体比率掩盖的切片和组件。

我们有多确定? 每一个驱动决定的数字都带有它的不确定性。

以后能经得起质询吗? 结果背后的记录会被保留,以便其他人核查。

联系方式