關於
我們打造量測層。
團隊每週都在對 AI 系統發布變更,卻無法說清上一次變更是否讓系統變得更好。Oloproof 是技術堆疊中以證據回答這個問題的那一部分:一個估計值、它的不確定性,以及一個你可以查核的決策。
我們如何決策
依據區間,而非估計值
當整個區間都越過門檻時,規則通過;當整個區間都未達門檻時,規則不通過。介於兩者之間的情況一律回報為證據不足,絕不會被捨入成通過。
我們主張什麼
不主張任何無法重現的事
一種統計方法要進入產品,必須附有書面說明、涵蓋率網格與一次稽核。在那之前,需要該方法的規則會以失敗收場,而不是借用它。
證據存放在哪裡
預設在你這裡
本機執行從不離開你的電腦。一次推送攜帶指標、區間與決策;除非你的專案另有設定,原始輸入、輸出與追蹤都留在本機。
評判器
先經過量測,才能把關
LLM 評判器在能夠決定發布之前,必須先對照人工標註進行檢驗,看的是其一致性的下界。
語言模型
在證據之上,而非證據之中
模型可以評判、解釋並建議下一個實驗。它們絕不會自創統計方法,也不會做出發布決策。
成本
同樣的證據絕不付兩次錢
每一次執行與評判都依其內容只儲存一次。再次執行未變更的測試套件時,會重用已有的結果。
它的用途
它有效嗎? 針對你宣告的情境與標準,並寫明分母。
它在哪裡失敗? 包括被整體比率掩蓋的切片與元件。
我們有多確定? 每一個驅動決策的數字都帶有它的不確定性。
日後經得起檢驗嗎? 結果背後的紀錄會被保留,讓其他人可以查核。