Skip to content

更新日志

发布了什么,以及它对发布决策意味着什么。

  1. SDK

    Oloproof 已登陆 PyPI

    oloproof 0.1.0a1 已发布,因此黄金路径从在干净环境中执行 pip install oloproof 开始,随后直接进入 oloproof init 和 oloproof run。版本由 CI 从带标签的提交构建并发布,通过 PyPI 可信发布完成,不存储任何令牌。

  2. 工作台

    回放一次运行如何得出决策

    提前停止的运行或比较现在会记录它进行的每一次查看,工作台会逐一回放:随时有效的区间在每次查看时逐步收窄,而阈值始终不动,以及每条规则作出决策的那一次查看。它只绘制引擎记录下的区间。固定样本区间绝不会被当作实时区间来做动画,因为盯着它直到结果好看,会使其保证失效。

  3. 工作台

    命令面板、键盘导航与证据链

    ⌘K 或 Ctrl+K 列出你能看到的所有目的地,粘贴运行 ID 或比较摘要即可直接打开。先按 g 再按一个字母即可跳转,j 和 k 在表格的行间移动,? 列出所有快捷键。用例会在其运行旁边打开,附带其证据链和为它做标注的人。开启减少动态效果时,所有动画都会停止。

  4. 托管

    oloproof.com 上的托管工作台

    工作台现已在 oloproof.com 上提供服务,端到端黄金路径也已在该主机上通过:一位审阅者标注了工作区抽取的 80 个用例,发现了评判器放过的 7 个错误答案,工作区基于其经过验证的样本判定为通过(91.2%,区间 74.5% 至 100.0%),而仅凭推送的运行,证据并不充分。仅限受邀访问。

  5. 追踪

    OpenTelemetry 追踪接入 oloproof collect

    oloproof collect 接收来自标准 OpenTelemetry SDK 的 OTLP/HTTP 数据,将 GenAI 和 OpenInference span 组装成按内容寻址的追踪记录,并把其内容保留在你的机器上;推送遵循你的出站策略。oloproof traces promote 会把一条追踪记录连同其来源信息转为测试用例,并拒绝重复项。

  6. 追踪

    基于生产流量样本的决策

    你的收集器每小时对其封存的每条追踪记录签署一份承诺。随后工作区用自己的随机性抽取样本,并将每条抽中的追踪记录与该承诺核对,因此无法通过扣留追踪记录来挑选样本。oloproof traces evaluate 基于记录下的输出评判该样本,工作区依据所有者固定的评估对其作出决策,置信序列则在项目的“生产”页面上跨样本跟踪每个指标。

  7. 评审

    浏览器中的评审队列

    所有者或管理员开启队列并指派审阅者,审阅者用键盘进行标注:通过或失败、按声明的量表打分,或在两次运行之间做盲选偏好,每一项都按账号记录。审阅者的浏览器凭一张五分钟有效的签名票据,从你这一侧的 oloproof collect 获取用例内容,因此工作区从不持有这些内容。

  8. 门控

    经过验证的执行

    运行可以由所有者注册的运行器密钥签名,也可以由托管 worker 签名。所有者固定整个评估(测试套件、评估器、指标和基线运行)及其门控策略,工作区在每个系统版本首次运行完全相同的这项评估时,以固定的运行为对照对其作出决策。人工标注只计入独立标注者的标注,并按账号计数。

  9. 评判器

    由工作区抽取的人工样本

    PPI 区间用人工标注的随机样本来校正评判器,而它的保证要求样本不由任何人挑选。现在,工作区会在运行的证据于工作区中冻结之后再抽取该样本,自行保管随机种子,并用自己的引擎核验校正后的区间。运行页面会注明工作区是否核验了某个区间;在你自己机器上抽取的样本仍标记为“善意”。

  10. 评估

    提前停止,以及由人工校正的评判器比率

    设置了 early_stopping: true 的策略会以带种子的批次运行用例,一旦每条规则都已作出决策,就停止一次运行,或让候选及其基线同步停止,并记录为 DECIDED_EARLY,同时注明它不再需要的用例。被停止的比率使用随时有效的下注区间,因此每批之后都查看也不会破坏其保证。评判器的通过率可以用 PPI 区间来设置门控,该区间将评判器与人工标注的盲随机样本相结合,并与仅评判器和仅人工的区间并列显示。

  11. 邮件

    邮件通知

    四种通知,每种都是成员可在邮件中直接关闭的一个类别:托管任务完成或失败;推送的运行或比较的门控阻止了发布;用量达到免费额度的 80% 和 100%;有成员加入。门控邮件会引用存储的决策并链接到该运行,不含任何用例内容。仅限邮件:不支持 Slack、寻呼或 webhook。

  12. 账号

    密码,以及删除账号

    除了通过身份提供方登录,也可以用邮箱地址和密码登录,并支持地址验证和密码重置。用户可以删除自己的账号:该用户以及仅有其一人所属的每个工作区会立即删除,worker 会清除这些工作区的证据。

  13. 评判器

    概率评判器、校准与级联

    评判器可以回答一个有类型的问题(是或否、一个选项、对照等级的打分),并为每个答案给出概率,这些概率在一次前向传播中从本地模型的 token 概率读出。它的校准以人工标注为参照来测量,并记录在其注册表条目中;级联只把廉价评判器拿不准的用例交给更强的评判器。训练好的分类器也可以充当评估器,无需密钥,也无需联网。

  14. 评判器

    以人工标注为准绳的评判器

    从文件或终端为一次运行的用例做标注,并在采用某个草稿评判器之前,先用这些标注试一试。评判器会在一致性旁边报告其偏差,偏差超过声明容差的评判器不得用于门控,一旦其所测量的模型发生变化,验证即不再计入。无需标注的探针会检查:在任何要紧的东西都没变时,裁决是否会变;成对比较会以两种顺序提问,因此仅因位置而被偏好的答案无需任何人标注就会显现出来。

  15. 智能体

    多智能体证据

    轨迹会记录每一步由哪个智能体执行,以及每一次交接。评估器会评判路由(请求是否到达了应处理它的智能体)、工具权限(是否有智能体调用了不该由它调用的工具),以及智能体来回传递控制权而迟迟不完成任务的情况;切片则按路由对用例分组。

  16. 评估

    重复测量与不稳定计数

    测试套件可以对每个用例测量多次。重复测量会在计算任何区间之前按用例聚合,比较会把它们作为比例配对,运行会报告有多少用例与自身结果不一致。系统可以把某个失败标记为暂时性的,让运行器重试:在一个真实的 RAG 系统上,这找回了 22 个缺失用例中的 18 个,并使区间收窄了 39%。