Comparación
Oloproof frente a las pruebas de prompts improvisadas.
Revisar a ojo en un playground es rápido y realmente útil mientras explora. Deja de bastar en el momento en que un cambio llega a los usuarios.
| Pregunta | Revisión a ojo en un playground | Oloproof |
|---|---|---|
| ¿Cambió la calidad? | Una impresión a partir de un puñado de salidas | Una diferencia con un intervalo del 95% sobre los casos emparejados, y una decisión tomada sobre el intervalo |
| ¿Para quién cambió? | Se desconoce | Por slice declarado: idioma, intención o cualquier clave de metadatos, la primera herramienta que llamó un agente, su ruta |
| ¿Puede volver a ejecutarlo el próximo trimestre? | No: los prompts y los casos ya no están | Sí: la suite, la versión del sistema y las versiones de los evaluadores se direccionan por contenido, y una muestra conserva su semilla |
| ¿Bloquea una publicación defectuosa? | Solo si alguien se acuerda de mirar | El gate termina con un código distinto de cero y el job de CI falla: 1 cuando una regla falla, 3 cuando la evidencia no decide |
| ¿Qué le muestra al equipo de riesgos o a un cliente? | Capturas de pantalla en un hilo | Un paquete exportado: la ejecución, su suite, sistema, evaluadores, casos y aprobaciones |
| Tiempo hasta la primera señal | Minutos | Minutos en local, y luego en cada cambio en el que su CI lo ejecute |
Dónde la revisión a ojo sigue ganando
La exploración inicial, depurar una salida extraña concreta y las comprobaciones básicas mientras escribe un prompt. Siga haciéndolo. Una suite de evaluación es lo que se construye cuando el comportamiento importa lo suficiente como para defenderlo.