关于
我们构建测量层。
团队每周都在向 AI 系统发布变更,却无法说清上一次变更是否让系统变得更好。Oloproof 是技术栈中用证据回答这个问题的那一部分:一个估计值、它的不确定性,以及一个你可以核查的决定。
我们如何决定
依据区间,而不是估计值
当整个区间都越过阈值时,规则通过;当整个区间都未达到阈值时,规则不通过。介于两者之间的情况一律报告为证据不足,绝不会被四舍五入成通过。
我们声明什么
不声明任何无法复现的东西
一种统计方法要进入产品,必须附有书面说明、覆盖率网格和一次审计。在此之前,需要该方法的规则会以失败告终,而不是借用它。
证据存放在哪里
默认在你这里
本地运行从不离开你的机器。一次推送携带指标、区间和决定;除非你的项目另有设置,原始输入、输出和追踪都留在本地。
评判器
先经过测量,再把关
LLM 评判器在可以决定发布之前,要先对照人工标注进行检验,看的是其一致性的下界。
语言模型
在证据之上,而不是在证据之中
模型可以评判、解释并建议下一个实验。它们绝不会自创统计方法,也不会作出发布决定。
成本
同样的证据绝不付两次钱
每一次执行和评判都按其内容只存储一次。再次运行未改动的测试套件时,会复用已有的结果。
它的用途
它有效吗? 针对你声明的场景和标准,并写明分母。
它在哪里失败? 包括被整体比率掩盖的切片和组件。
我们有多确定? 每一个驱动决定的数字都带有它的不确定性。
以后能经得起质询吗? 结果背后的记录会被保留,以便其他人核查。