Porównanie
Oloproof a doraźne testowanie promptów.
Wyrywkowe sprawdzanie w playgroundzie jest szybkie i naprawdę przydatne, dopóki eksplorujesz. Przestaje wystarczać w chwili, gdy zmiana trafia do użytkowników.
| Pytanie | Wyrywkowe sprawdzenie w playgroundzie | Oloproof |
|---|---|---|
| Czy jakość się zmieniła? | Wrażenie z garstki odpowiedzi | Różnica z przedziałem 95% na sparowanych przypadkach i decyzja podjęta na podstawie przedziału |
| Dla kogo się zmieniła? | Nie wiadomo | Dla każdego zadeklarowanego wycinka: język, intencja lub dowolny klucz metadanych, pierwsze narzędzie wywołane przez agenta, jego trasa |
| Czy uruchomisz to ponownie w następnym kwartale? | Nie: prompty i przypadki przepadły | Tak: zestaw, wersja systemu i wersje ewaluatorów są adresowane treścią, a próbka zachowuje swoje ziarno |
| Czy zablokuje złe wydanie? | Tylko jeśli ktoś pamięta, żeby sprawdzić | Bramka kończy działanie z kodem różnym od zera, a zadanie CI kończy się niepowodzeniem: 1, gdy reguła nie jest spełniona, 3, gdy dowody nie rozstrzygają |
| Co pokazujesz działowi ryzyka lub klientowi? | Zrzuty ekranu w wątku | Wyeksportowany pakiet: przebieg, jego zestaw, system, ewaluatory, przypadki i zatwierdzenia |
| Czas do pierwszego sygnału | Minuty | Minuty lokalnie, potem przy każdej zmianie, na której uruchamia to twoje CI |
Gdzie wyrywkowe sprawdzanie wciąż wygrywa
Wczesna eksploracja, debugowanie pojedynczej dziwnej odpowiedzi i podstawowe kontrole podczas pisania promptu. Rób to dalej. Zestaw ewaluacyjny buduje się wtedy, gdy zachowanie jest na tyle ważne, że trzeba go bronić.