Skip to content

Over ons

Wij bouwen de meetlaag.

Teams brengen elke week wijzigingen aan AI-systemen uit zonder te kunnen zeggen of de laatste ze beter heeft gemaakt. Oloproof is het deel van de stack dat die vraag met bewijs beantwoordt: een schatting, de onzekerheid ervan en een beslissing die je kunt controleren.

Hoe we beslissen

Op het interval, niet op de schatting

Een regel slaagt als het hele interval de drempel haalt en faalt als het hele interval die mist. Alles daartussen wordt gemeld als onvoldoende bewijs en nooit afgerond naar geslaagd.

Wat we beweren

Niets wat we niet kunnen reproduceren

Een statistische methode komt in het product met een geschreven notitie, een dekkingsraster en een audit. Tot die tijd faalt een regel die haar nodig zou hebben veilig, in plaats van haar te lenen.

Waar bewijs staat

Standaard bij jou

Lokale runs verlaten je machine nooit. Een push bevat metrics, intervallen en beslissingen, en laat ruwe inputs, outputs en traces bij jou, tenzij je project anders bepaalt.

Judges

Gemeten voordat ze tegenhouden

Een LLM-judge wordt getoetst aan menselijke labels, op de ondergrens van zijn overeenstemming, voordat hij over een release mag beslissen.

Taalmodellen

Boven het bewijs, niet erin

Modellen mogen beoordelen, uitleggen en het volgende experiment voorstellen. Ze bedenken nooit een statistische methode en nemen nooit de releasebeslissing.

Kosten

Nooit twee keer betalen voor hetzelfde bewijs

Elke uitvoering en elk oordeel wordt eenmaal opgeslagen, op basis van de inhoud. Een ongewijzigde suite opnieuw draaien hergebruikt wat er al is.

Waar het voor is

Werkt het? Voor de scenario’s en criteria die je hebt gedeclareerd, met de noemer erbij.

Waar faalt het? Inclusief de slices en componenten die een totaalpercentage verbergt.

Hoe zeker zijn we? Elk getal dat een beslissing stuurt, draagt zijn onzekerheid mee.

Is het later te verdedigen? Het verslag achter een resultaat wordt bewaard, zodat iemand anders het kan controleren.

Contact