ガイド
現在動作するもの
現在 Oloproof で何を評価できるか、それにどう到達するか(Python SDK、oloproof.yaml と CLI、またはブラウザー)、そして何が作られていないかを示します。このページは 2026 年 10 月 8 日の機能監査に基づいています。これは社内レビューで、各行を計画ではなくコードとそのテストに照らして確認しました。
このページの読み方
「SDK」は Python パッケージ(import oloproof)を意味します。「YAML」は oloproof.yaml から oloproof run で実行するプロジェクトを意味します。これらは同じ入口ではありません。いくつかの評価器はどちらか一方にしか存在せず、このページはそれがどちらかを示します。「ブラウザー」はホストされたワークベンチを意味し、oloproof push したものを表示します。コードや YAML で定義していない評価を実行することはありません。
Oloproof はあなたのシステムを呼び出しますが、それをホストしたり、サンドボックス化したり、リセットしたりはしません。実行中の状態、セッション、ツールの副作用はあなたのアプリケーションが持ちます。
システムの種類別
| あなたのシステム | 動作するもの | どこで | 未実装 |
|---|---|---|---|
| 分類器または構造化出力 | 完全一致、包含、正規表現、JSON スキーマ、ルーブリックジャッジ、確率ジャッジ、モデル分類器。区間付きの合格率 | SDK と YAML。model_classifier、probability_judge、cascade は YAML のみ | n/a |
| テキスト生成、要約、抽出 | 自由テキストに対する同じチェック、ルーブリックジャッジ、人間のラベルに対するジャッジの一致度、ペアワイズ選好 | SDK と YAML。選好は oloproof prefer コマンド | BLEU、ROUGE、埋め込み類似度(@evaluator で書いてください) |
| ブラックボックスとして実行する RAG | ヒット率、再現率、MRR、nDCG、引用の妥当性、根拠性と引用の裏付けのジャッジ。システムが記録または返す検索アーティファクトから | SDK と YAML | 診断。diagnose には段階構成のシステムが必要 |
| 段階構成の RAG | 上記すべて、段階ごとのキャッシュ、そして対照と並べたゴールドコンテキスト、top-k、リランカーの変更による oloproof diagnose | SDK の @rag_system、YAML の system.rag、CLI の diagnose | その 3 つ以外の介入 |
| ツールを使うエージェント | ステップ上限、必須ツールと禁止ツール、ツールの順序、ループ、制約。記録された軌跡から | SDK と YAML | LLM で判定する軌跡品質チェック |
| マルチエージェントシステム | ルーティング、エージェントごとのツール権限、ハンドオフ上限 | SDK と YAML | n/a |
| エージェントのリプレイ | チェックポイントからケースを再実行し、ステップが必要だったかどうかをラベル付けする | SDK のみ(replay_case)、チェックポイントに対応したシステム向け | CLI コマンド |
| 二値分類モデル | 正解率、適合率、再現率、Brier、対数損失、ランキング(AUC) | SDK と YAML の predictive: | n/a |
| 多クラスモデル | クラスごとに 1 ブロック(一対他) | SDK と YAML | マクロ平均またはマイクロ平均 |
| 回帰モデル | 宣言した target_range 内の絶対誤差 | SDK と YAML | 二乗誤差、R 二乗、上限のない誤差 |
| マルチターン会話 | 台本のすべてのターンに回答したかどうか、そして会話全体に対するルーブリックジャッジ | SDK のみ(ConversationCompleted、ConversationJudge) | YAML の型、ターン単位のスコア、ユーザーシミュレーター、会話のリプレイ |
| 画像、音声、動画 | ネイティブなものはありません。ケースは URL やエンコードしたファイルをシステムに渡すことができ、@evaluator で出力をチェックできます | n/a | ジャッジが見るのは JSON テキストのみ。メディアのアーティファクトや描画はありません |
マルチターンの回避策として、各ターンを 1 つのケースにし、1 つの会話のターンに同じ group_id を与えれば、分析はそれらをクラスターとして扱います(クラスター)。その場合、各ターンは記録された 1 つの対話ではなく、別々の呼び出しになります。
システムをつなぐ
- Python の呼び出し可能オブジェクト:SDK の @system、または YAML の system.callable: module:function。ケースの input を受け取り、辞書を返します。同期関数も非同期関数も動作します。
- HTTP:url、method、output_path、artifacts、timeout_s を持つ system.http。ケースの入力は JSON ボディとして送信され、レスポンスは JSON として読まれます。ヘッダーと認証はまだ設定できません。キーが必要なエンドポイントは、キーを付け加える呼び出し可能オブジェクトの背後に置いてください。
- カスタム評価器:SDK の @evaluator。oloproof.yaml ではまだ名前を指定できません。
ワークフロー
| ワークフロー | 動作するもの | 未実装 |
|---|---|---|
| 2 つのバージョンを比較する | ペアでの優越性、非劣性、同等性。多重性を制御したスライス | n/a |
| CI | ポリシーの block_on に基づく oloproof gate の終了コード、サインオフ、署名付きレコード、プルリクエストの要約(--summary markdown) | n/a |
| 人間によるレビュー | ファイルまたはターミナルからのラベル。ホストされたワークスペースでの、担当者を割り当てたブラウザーのレビューキュー | ローカルプロジェクトでのブラウザーのレビューキュー |
| ブラウザーのワークベンチ | oloproof push の後の、実行、ケース、比較、診断、評価器、レビュー、トラフィック | データセットのインポート、ジャッジの作成、スケジュール、アラート、ポストモーテム(予定として表示) |
| ローカルのブラウザー | n/a | ワークベンチをローカルで提供する CLI コマンドはありません。ワークベンチはホストされています |
何がどのようにテストされているか
上記のすべてのファミリーには、フィクスチャとモックしたプロバイダーで実行される自動テストがあります。実際のシステムを実際のモデルで動かした実行は、RAG、単一エージェント、マルチターン会話について記録されています。予測モデルとマルチエージェントシステムについてはまだありません。リリースを決める統計手法は、それぞれ独自の監査によって認められています。認められた区間を持たないメトリクスは区間に基づいてルールを決めず、それを必要とするルールは理由とともに MANUAL_REVIEW または INSUFFICIENT_EVIDENCE を返します。