Skip to content

Sobre

Construímos a camada de medição.

Equipes lançam mudanças em sistemas de IA toda semana sem ter como dizer se a última os melhorou. O Oloproof é a parte da stack que responde a essa pergunta com evidências: uma estimativa, sua incerteza e uma decisão que você pode verificar.

Como decidimos

Pelo intervalo, não pela estimativa

Uma regra passa quando o intervalo inteiro supera o limiar e falha quando o intervalo inteiro fica aquém dele. Qualquer coisa no meio é relatada como evidência insuficiente, nunca arredondada para uma aprovação.

O que afirmamos

Nada que não pudéssemos reproduzir

Um método estatístico entra no produto com uma nota escrita, uma grade de cobertura e uma auditoria. Até lá, uma regra que precisaria dele falha de forma segura em vez de tomá-lo emprestado.

Onde ficam as evidências

Com você, por padrão

Execuções locais nunca saem da sua máquina. Um push leva métricas, intervalos e decisões, e deixa em casa as entradas brutas, saídas e traces, a menos que seu projeto diga o contrário.

Juízes

Medidos antes de bloquear

Um juiz LLM é conferido com rótulos humanos, pelo limite inferior da sua concordância, antes de poder decidir uma release.

Modelos de linguagem

Acima das evidências, não dentro delas

Os modelos podem julgar, explicar e sugerir o próximo experimento. Eles nunca inventam um método estatístico nem tomam a decisão de release.

Custo

Nunca pague duas vezes pela mesma evidência

Cada execução e cada julgamento é armazenado uma vez, pelo seu conteúdo. Rodar de novo uma suíte inalterada reaproveita o que ela já tem.

Para que serve

Funciona? Para os cenários e critérios que você declarou, com o denominador informado.

Onde falha? Incluindo os recortes e componentes que uma taxa global esconde.

Qual é a nossa certeza? Todo número que orienta uma decisão traz a sua incerteza.

Dá para defender depois? O registro por trás de um resultado é guardado, para que outra pessoa possa verificá-lo.

Entre em contato