概要
私たちは測定レイヤーをつくっています。
チームは毎週 AI システムに変更をリリースしていますが、直前の変更で良くなったのかどうかを言う手段がありません。Oloproof は、その問いにエビデンスで答えるスタックの一部です。推定値、その不確実性、そして検証できる判断を示します。
判断の仕方
推定値ではなく区間で
ルールは、区間全体がしきい値を上回ったときに合格し、区間全体が下回ったときに不合格になります。その中間はすべてエビデンス不十分として報告され、合格に丸められることはありません。
主張すること
再現できないことは何も主張しない
統計手法がプロダクトに入るには、文書化されたノート、カバレッジグリッド、監査が必要です。それまでは、その手法を必要とするルールは手法を借用せず、安全側に倒れて失敗します。
エビデンスの置き場所
デフォルトではお手元に
ローカル実行がお手元のマシンの外に出ることはありません。プッシュで送られるのはメトリクス、区間、判断であり、プロジェクトで別途指定しない限り、生の入力、出力、トレースは手元に残ります。
ジャッジ
ゲートする前に測定される
LLM ジャッジは、リリースを判断できるようになる前に、人手のラベルと照合され、その一致度の下限で検証されます。
言語モデル
エビデンスの内側ではなく、その上に
モデルは判定し、説明し、次の実験を提案できます。統計手法を考案したり、リリースの判断を下したりすることは決してありません。
コスト
同じエビデンスに二度支払わない
すべての実行と判定は、その内容によって一度だけ保存されます。変更のないスイートを再実行すると、すでにあるものが再利用されます。
何のためにあるのか
機能しているか? 宣言したシナリオと基準について、分母を明示して答えます。
どこで失敗するのか? 全体の割合に隠れてしまうスライスやコンポーネントも含めて。
どれくらい確かなのか? 判断を左右するすべての数値に、その不確実性が付いています。
後から説明責任を果たせるか? 結果の裏付けとなる記録が保管されるので、他の人が検証できます。