Skip to content

概要

私たちは測定レイヤーをつくっています。

チームは毎週 AI システムに変更をリリースしていますが、直前の変更で良くなったのかどうかを言う手段がありません。Oloproof は、その問いにエビデンスで答えるスタックの一部です。推定値、その不確実性、そして検証できる判断を示します。

判断の仕方

推定値ではなく区間で

ルールは、区間全体がしきい値を上回ったときに合格し、区間全体が下回ったときに不合格になります。その中間はすべてエビデンス不十分として報告され、合格に丸められることはありません。

主張すること

再現できないことは何も主張しない

統計手法がプロダクトに入るには、文書化されたノート、カバレッジグリッド、監査が必要です。それまでは、その手法を必要とするルールは手法を借用せず、安全側に倒れて失敗します。

エビデンスの置き場所

デフォルトではお手元に

ローカル実行がお手元のマシンの外に出ることはありません。プッシュで送られるのはメトリクス、区間、判断であり、プロジェクトで別途指定しない限り、生の入力、出力、トレースは手元に残ります。

ジャッジ

ゲートする前に測定される

LLM ジャッジは、リリースを判断できるようになる前に、人手のラベルと照合され、その一致度の下限で検証されます。

言語モデル

エビデンスの内側ではなく、その上に

モデルは判定し、説明し、次の実験を提案できます。統計手法を考案したり、リリースの判断を下したりすることは決してありません。

コスト

同じエビデンスに二度支払わない

すべての実行と判定は、その内容によって一度だけ保存されます。変更のないスイートを再実行すると、すでにあるものが再利用されます。

何のためにあるのか

機能しているか? 宣言したシナリオと基準について、分母を明示して答えます。

どこで失敗するのか? 全体の割合に隠れてしまうスライスやコンポーネントも含めて。

どれくらい確かなのか? 判断を左右するすべての数値に、その不確実性が付いています。

後から説明責任を果たせるか? 結果の裏付けとなる記録が保管されるので、他の人が検証できます。