Skip to content

O nas

Budujemy warstwę pomiarową.

Zespoły co tydzień wdrażają zmiany w systemach AI i nie mają jak stwierdzić, czy ostatnia z nich coś poprawiła. Oloproof to ta część stosu, która odpowiada na to pytanie dowodami: oszacowaniem, jego niepewnością i decyzją, którą możesz sprawdzić.

Jak decydujemy

Na podstawie przedziału, nie oszacowania

Reguła przechodzi, gdy cały przedział przekracza jej próg, a nie przechodzi, gdy cały przedział go nie osiąga. Wszystko pomiędzy jest raportowane jako niewystarczające dowody i nigdy nie jest zaokrąglane do zaliczenia.

Co twierdzimy

Nic, czego nie moglibyśmy odtworzyć

Metoda statystyczna trafia do produktu z pisemną notatką, siatką pokrycia i audytem. Do tego czasu reguła, która by jej potrzebowała, bezpiecznie kończy się niepowodzeniem, zamiast ją pożyczać.

Gdzie są dowody

Domyślnie u Ciebie

Uruchomienia lokalne nigdy nie opuszczają Twojego komputera. Push przenosi metryki, przedziały i decyzje, a surowe wejścia, wyjścia i ślady zostawia u Ciebie, chyba że Twój projekt stanowi inaczej.

Sędziowie

Zmierzeni, zanim zaczną blokować

Sędzia LLM jest sprawdzany względem etykiet ludzkich, na podstawie dolnej granicy jego zgodności, zanim będzie mógł zdecydować o wydaniu.

Modele językowe

Ponad dowodami, nie w ich wnętrzu

Modele mogą oceniać, wyjaśniać i proponować kolejny eksperyment. Nigdy nie wymyślają metody statystycznej ani nie podejmują decyzji o wydaniu.

Koszt

Nigdy nie płać dwa razy za te same dowody

Każde wykonanie i każda ocena są zapisywane raz, według ich treści. Ponowne uruchomienie niezmienionego zestawu wykorzystuje to, co już ma.

Do czego służy

Czy to działa? Dla zadeklarowanych przez Ciebie scenariuszy i kryteriów, z podanym mianownikiem.

Gdzie zawodzi? Łącznie z wycinkami i komponentami, które ukrywa wskaźnik ogólny.

Jak bardzo jesteśmy pewni? Każda liczba, na której opiera się decyzja, niesie swoją niepewność.

Czy da się tego później obronić? Zapis stojący za wynikiem jest przechowywany, aby ktoś inny mógł go sprawdzić.