Skip to content

Porównanie

Oloproof a doraźne testowanie promptów.

Wyrywkowe sprawdzanie w playgroundzie jest szybkie i naprawdę przydatne, dopóki eksplorujesz. Przestaje wystarczać w chwili, gdy zmiana trafia do użytkowników.

Pytania, które zespół zadaje o zmianę, z odpowiedziami wyrywkowego sprawdzenia w playgroundzie i Oloproof
PytanieWyrywkowe sprawdzenie w playgroundzieOloproof
Czy jakość się zmieniła?Wrażenie z garstki odpowiedziRóżnica z przedziałem 95% na sparowanych przypadkach i decyzja podjęta na podstawie przedziału
Dla kogo się zmieniła?Nie wiadomoDla każdego zadeklarowanego wycinka: język, intencja lub dowolny klucz metadanych, pierwsze narzędzie wywołane przez agenta, jego trasa
Czy uruchomisz to ponownie w następnym kwartale?Nie: prompty i przypadki przepadłyTak: zestaw, wersja systemu i wersje ewaluatorów są adresowane treścią, a próbka zachowuje swoje ziarno
Czy zablokuje złe wydanie?Tylko jeśli ktoś pamięta, żeby sprawdzićBramka kończy działanie z kodem różnym od zera, a zadanie CI kończy się niepowodzeniem: 1, gdy reguła nie jest spełniona, 3, gdy dowody nie rozstrzygają
Co pokazujesz działowi ryzyka lub klientowi?Zrzuty ekranu w wątkuWyeksportowany pakiet: przebieg, jego zestaw, system, ewaluatory, przypadki i zatwierdzenia
Czas do pierwszego sygnałuMinutyMinuty lokalnie, potem przy każdej zmianie, na której uruchamia to twoje CI

Gdzie wyrywkowe sprawdzanie wciąż wygrywa

Wczesna eksploracja, debugowanie pojedynczej dziwnej odpowiedzi i podstawowe kontrole podczas pisania promptu. Rób to dalej. Zestaw ewaluacyjny buduje się wtedy, gdy zachowanie jest na tyle ważne, że trzeba go bronić.