Comparação
Oloproof versus testes de prompt improvisados.
Conferir por amostragem em um playground é rápido e realmente útil enquanto você está explorando. Deixa de bastar no momento em que uma mudança chega aos usuários.
| Pergunta | Conferência por amostragem no playground | Oloproof |
|---|---|---|
| A qualidade mudou? | Uma impressão a partir de um punhado de saídas | Uma diferença com um intervalo de 95% sobre os casos pareados, e uma decisão tomada com base no intervalo |
| Para quem mudou? | Desconhecido | Por slice declarado: idioma, intenção ou qualquer chave de metadados, a primeira ferramenta que um agente chamou, sua rota |
| Dá para executar de novo no próximo trimestre? | Não: os prompts e os casos se perderam | Sim: a suíte, a versão do sistema e as versões dos avaliadores são endereçadas por conteúdo, e uma amostra guarda sua seed |
| Isso bloqueia um lançamento ruim? | Só se alguém se lembrar de olhar | O gate sai com código diferente de zero e o job de CI falha: 1 quando uma regra falha, 3 quando a evidência não decide |
| O que você mostra à área de risco ou a um cliente? | Capturas de tela em uma conversa | Um pacote exportado: a execução, sua suíte, sistema, avaliadores, casos e aprovações |
| Tempo até o primeiro sinal | Minutos | Minutos localmente, depois a cada mudança em que seu CI o executar |
Onde a conferência por amostragem ainda vence
Exploração inicial, depuração de uma única saída estranha e verificações básicas enquanto você escreve um prompt. Continue fazendo isso. Uma suíte de avaliação é o que você constrói quando o comportamento importa o bastante para ser defendido.