更新日誌
發布了什麼,以及它對發布決策意味著什麼。
Oloproof 已登上 PyPI
oloproof 0.1.0a1 已發布,因此黃金路徑從在乾淨環境中執行 pip install oloproof 開始,隨後直接進入 oloproof init 與 oloproof run。版本由 CI 從加上標籤的提交建置並發布,透過 PyPI 受信任發布完成,不儲存任何權杖。
重播一次執行如何得出決策
提前停止的執行或比較現在會記錄它進行的每一次查看,工作台會逐一重播:隨時有效的區間在每次查看時逐步收窄,而門檻始終不動,以及每條規則作出決策的那一次查看。它只繪製引擎記錄下來的區間。固定樣本區間絕不會被當成即時區間來製作動畫,因為盯著它直到結果好看,會使其保證失效。
命令面板、鍵盤導覽與證據鏈
⌘K 或 Ctrl+K 會列出您能看到的所有目的地,貼上執行 ID 或比較摘要即可直接開啟。先按 g 再按一個字母即可跳轉,j 與 k 在表格的列之間移動,? 列出所有快速鍵。案例會在其執行旁邊開啟,並附上其證據鏈與為它標註的人。開啟減少動態效果時,所有動畫都會停止。
oloproof.com 上的託管工作台
工作台現已在 oloproof.com 上提供服務,端到端黃金路徑也已在該主機上通過:一位審閱者標註了工作區抽取的 80 個案例,找出評判器放過的 7 個錯誤答案,工作區依據其經過驗證的樣本判定為通過(91.2%,區間 74.5% 至 100.0%),而單憑推送的執行,證據並不充分。僅限受邀存取。
OpenTelemetry 追蹤接入 oloproof collect
oloproof collect 接收來自標準 OpenTelemetry SDK 的 OTLP/HTTP 資料,將 GenAI 與 OpenInference span 組裝成以內容定址的追蹤紀錄,並把其內容保留在您的機器上;推送遵循您的對外傳輸政策。oloproof traces promote 會把一筆追蹤紀錄連同其來源資訊轉為測試案例,並拒絕重複項目。
以生產流量樣本作出的決策
您的收集器每小時對其封存的每筆追蹤紀錄簽署一份承諾。接著工作區以自己的隨機性抽取樣本,並將每筆抽中的追蹤紀錄與該承諾核對,因此無法藉由扣留追蹤紀錄來挑選樣本。oloproof traces evaluate 依據記錄下來的輸出評判該樣本,工作區依據擁有者固定的評估對其作出決策,信賴序列則在專案的「生產」頁面上跨樣本追蹤每個指標。
瀏覽器中的審查佇列
擁有者或管理員開啟佇列並指派審閱者,審閱者以鍵盤進行標註:通過或失敗、依宣告的量表評分,或在兩次執行之間做盲測偏好,每一項都依帳號記錄。審閱者的瀏覽器憑一張五分鐘有效的簽章票證,從您這一端的 oloproof collect 取得案例內容,因此工作區從不持有這些內容。
經過驗證的執行
執行可以由擁有者註冊的執行器金鑰簽章,也可以由託管 worker 簽章。擁有者固定整個評估(測試套件、評估器、指標與基準執行)及其閘門政策,工作區在每個系統版本首次執行完全相同的這項評估時,以固定的執行為對照對其作出決策。人工標註只計入獨立標註者的標註,並依帳號計數。
由工作區抽取的人工樣本
PPI 區間以人工標註的隨機樣本來校正評判器,而它的保證要求樣本不由任何人挑選。現在,工作區會在執行的證據於工作區中凍結之後才抽取該樣本,自行保管隨機種子,並以自己的引擎核驗校正後的區間。執行頁面會註明工作區是否核驗了某個區間;在您自己機器上抽取的樣本仍標示為「善意」。
提前停止,以及由人工校正的評判器比率
設定了 early_stopping: true 的政策會以帶種子的批次執行案例,一旦每條規則都已作出決策,就停止一次執行,或讓候選及其基準同步停止,並記錄為 DECIDED_EARLY,同時註明它不再需要的案例。被停止的比率使用隨時有效的下注區間,因此每批之後都查看也不會破壞其保證。評判器的通過率可以用 PPI 區間設定閘門,該區間將評判器與人工標註的盲測隨機樣本結合,並與僅評判器及僅人工的區間並列顯示。
電子郵件通知
四種通知,每種都是成員可在郵件中直接關閉的一個類別:託管工作完成或失敗;推送的執行或比較的閘門阻擋了發布;用量達到免費額度的 80% 與 100%;有成員加入。閘門郵件會引用儲存的決策並連結到該執行,不含任何案例內容。僅限電子郵件:不支援 Slack、呼叫器或 webhook。
密碼,以及刪除帳號
除了透過身分提供者登入,也可以用電子郵件地址與密碼登入,並支援地址驗證與密碼重設。使用者可以刪除自己的帳號:該使用者以及只有其一人所屬的每個工作區會立即刪除,worker 會清除這些工作區的證據。
機率評判器、校準與串聯
評判器可以回答一個有型別的問題(是或否、一個選項、對照等級的評分),並為每個答案給出機率,這些機率在一次前向傳遞中從本機模型的 token 機率讀出。它的校準以人工標註為參照來量測,並記錄在其登錄項目中;串聯只把低成本評判器沒把握的案例交給更強的評判器。訓練好的分類器也可以充當評估器,不需金鑰,也不需連網。
以人工標註為準繩的評判器
從檔案或終端機為一次執行的案例做標註,並在採用某個草稿評判器之前,先用這些標註試一試。評判器會在一致性旁邊回報其偏差,偏差超過宣告容差的評判器不得用於閘門,一旦其所量測的模型改變,驗證即不再計入。無需標註的探針會檢查:在任何要緊的東西都沒變時,裁決是否會變;成對比較會以兩種順序提問,因此僅因位置而被偏好的答案無需任何人標註就會顯現出來。
多代理證據
軌跡會記錄每一步由哪個代理執行,以及每一次交接。評估器會評判路由(請求是否到達應處理它的代理)、工具權限(是否有代理呼叫了不該由它呼叫的工具),以及代理來回傳遞控制權而遲遲不完成任務的情況;切片則依路由將案例分組。
重複量測與不穩定計數
測試套件可以對每個案例量測多次。重複量測會在計算任何區間之前依案例彙總,比較會把它們當作比例配對,執行會回報有多少案例與自身結果不一致。系統可以把某個失敗標記為暫時性的,讓執行器重試:在一個真實的 RAG 系統上,這找回了 22 個遺失案例中的 18 個,並使區間收窄了 39%。