本文へスキップ

すでに実際の仕事をしている AI のために

本番環境で AI が何をしているかをレビューする。

稼働を始めたら、Oloproof が実際のトラフィックから抽出したサンプルを人がブラウザでレビューし、コンテンツはお客様の側にとどまります。ワークスペースは、誰かが見せることを選んだものではなく、レビューで見つかったことにもとづいて判断します。

抽出

誰も選んでいないサンプル

コレクターは OpenTelemetry でトレースを受け取り、封印した 1 時間ごとに署名付きの Merkle ルートでコミットします。その後ワークスペースが自身の乱数でサンプルを抽出し、抽出したトレースをそれぞれそのコミットと照合するため、コレクターが封印したトレースのうち、抽出から外せるものはありません。

レビュー

ブラウザでのレビュー

Owner または Admin がレビューキューを開き、レビュアーを割り当てます。各レビュアーは合格か不合格の判定、宣言した尺度でのスコア、または 2 つの出力のブラインドでの選好を付け、それぞれ本人のアカウントで記録されます。測定のために抽出された項目は、ジャッジの判定を伏せて表示されます。

保持

コンテンツはお客様の側に

既定の送信ポリシーでは、ワークスペースは入力も出力も保持しません。レビュアーのブラウザは、デプロイメントが署名する 5 分間有効のチケットで、お客様のネットワーク上のコレクターから各項目のコンテンツを取得し、Oloproof はそれを保存しません。

ワークスペースが判断すること

ワークスペースが抽出したサンプルへの合格・不合格の判定は、予測駆動型推論によってジャッジの合格率を補正し、ワークスペースは自身のエンジンでその区間を検証します。数えるのは自ら封印したラベルだけで、それも互いに独立したアカウントからのものに限られ、すべての実行と同じ 4 つの状態(合格、不合格、エビデンス不十分、手動レビュー)で判断します。スコアと選好は保存・表示されますが、その手法が承認されるまでどの統計にも入りません。