Voor AI die al echt werk doet
Beoordeel wat je AI in productie doet.
Zodra het live is, beoordelen mensen in de browser een steekproef die Oloproof uit echt verkeer trekt, terwijl de inhoud bij jou blijft. De workspace beslist op wat zij vonden, niet op wat iemand ervoor koos hem te laten zien.
Trekken
Een steekproef die niemand koos
Je collector ontvangt je traces via OpenTelemetry en legt zich voor elk uur dat hij heeft verzegeld vast met een ondertekende Merkle-root. Daarna trekt de workspace de steekproef met zijn eigen willekeur en controleert elke getrokken trace tegen die vastlegging, zodat geen enkele trace die de collector heeft verzegeld buiten de trekking kan worden gehouden.
Review
Beoordelaars in de browser
Een Owner of Admin opent een beoordelingswachtrij en wijst beoordelaars toe. Ieder geeft een oordeel geslaagd of niet geslaagd, een score op een vastgelegde schaal of een blinde voorkeur tussen twee uitvoeren, vastgelegd onder het eigen account. Items die voor meting zijn getrokken, worden getoond zonder het oordeel van de judge.
Bewaren
De inhoud blijft bij jou
Onder het standaard egressbeleid houdt de workspace geen invoer of uitvoer vast. De browser van de beoordelaar haalt de inhoud van elk item op bij de collector in je netwerk, met een ticket van vijf minuten dat de deployment ondertekent, en Oloproof slaat het nooit op.
Wat de workspace beslist
Oordelen geslaagd of niet geslaagd over een steekproef die de workspace trok corrigeren het slagingspercentage van een judge, met prediction-powered inference, en de workspace verifieert dat interval met zijn eigen engine. Hij telt alleen labels die hij zelf heeft verzegeld, van onafhankelijke accounts, en beslist met dezelfde vier toestanden als elke run: geslaagd, niet geslaagd, onvoldoende bewijs of handmatige beoordeling. Scores en voorkeuren worden opgeslagen en getoond, en tellen in geen enkele statistiek mee totdat er een methode voor is toegelaten.