Saltar al contenido

Guías

Empiece aquí

Qué hace Oloproof, cuándo usarlo y cuándo no, y en qué orden leer estas guías: desde una primera evaluación de una aplicación hasta la comparación de versiones, la revisión, la CI y los contratos exactos.

Qué hace Oloproof

Oloproof ejecuta su aplicación de IA sobre un conjunto fijo de casos, comprueba cada salida con los evaluadores que usted elija y convierte los resultados en tasas con intervalos. Una política de publicación que usted escribe decide entonces cada regla como PASS, FAIL, INSUFFICIENT_EVIDENCE o MANUAL_REVIEW, y el comando termina según esa decisión para que la CI pueda usarla. Todo se ejecuta en su máquina; nada sale de ella a menos que usted haga push de una ejecución a un espacio de trabajo alojado. Los términos se definen en Conceptos básicos.

Úselo cuando necesite saber si una aplicación alcanza un nivel declarado sobre casos en los que confía, con qué seguridad lo hace y si un cambio la mejoró o la empeoró. Oloproof llama a su sistema; no lo aloja, no lo aísla ni lo reinicia, y su aplicación gestiona su propio estado, sus sesiones y los efectos secundarios de sus herramientas. Para saber qué está construido y qué no, por tipo de sistema, lea Qué funciona hoy antes de comprometerse.

Estas guías describen Oloproof 0.1.0a5. pip show oloproof muestra la versión que tiene instalada; una más antigua puede carecer de un comando o una opción que aparece aquí, como oloproof init --example, y pip install --upgrade --pre oloproof la actualiza.

El recorrido

PasoQué hace ustedLectura
1Aprender qué hace Oloproof y cuándo usarloEsta página, Conceptos básicos, Qué funciona hoy
2Evaluar su primera aplicación, sin línea baseGuía rápida
3Elegir una guía para su tipo de sistemaLa tabla de abajo
4Inspeccionar los fallos y entender el resultadoSuites, Errores, Casos agrupados, Segmentos
5Cambiar el sistema y comparar versionesComparar, Reglas de comparación
6Añadir revisión humana, colaboración y CIJueces, Gating, CI, Notificaciones
7Consultar los contratos técnicos exactosConfiguración, Referencia del SDK, Resultados, CLI

Una primera evaluación no necesita línea base: pregunta si una versión de su aplicación cumple sus requisitos. La comparación de dos versiones llega en el paso 5, cuando ya tiene una ejecución con la que valga la pena comparar.

Elija su tipo de sistema

Su sistemaEmpiece por
Un clasificador, un enrutador o una salida estructurada (una etiqueta, un objeto JSON)Clasificación
Texto libre: respuestas, resúmenes, extracciónGeneración de texto
Un servicio al que se accede por HTTP, en cualquier lenguajeUn endpoint HTTP
Generación aumentada con recuperaciónRAG
Un agente que usa herramientas, o varios agentesAgentes
Un modelo predictivo entrenado (clasificación o regresión)Modelos predictivos
Una conversación de varios turnosConversaciones

Las imágenes, el audio y el vídeo no tienen soporte nativo: un caso puede llevar una URL o un archivo codificado a través de su sistema, y un evaluador personalizado puede comprobar la salida, pero los jueces solo ven texto JSON.