Para equipos de RAG y recuperación
Sabe qué hizo tu cambio de índice.
Los cambios de recuperación mueven la calidad de formas que un diff del chunking no puede mostrar. Oloproof ejecuta tu sistema RAG como dos etapas que puede ver, y mide recuperación, citas, fundamentación y corrección de las respuestas sobre los mismos casos, antes y después.
Medir
Evaluadores conscientes de la recuperación
Tasa de aciertos, recall, MRR y nDCG en el corte que elijas, leídos de los candidatos registrados; validez de las citas frente al contexto que recibió el modelo; jueces de fundamentación y de respaldo de citas que lo leen. Un corte más profundo de lo que devolvió el recuperador se rechaza, no se puntúa como fallo.
Aislar
Una etapa cada vez
Cada etapa se almacena en caché por separado, así que un cambio de prompt nunca vuelve a buscar. El diagnóstico vuelve a ejecutar los casos fallidos con el pasaje correcto junto a un control y etiqueta cada uno como fallo de recuperación, fuera del ranking, perdido del contexto o fallo de generación.
Decidir
El gate se decide con el intervalo
Candidato y línea base se emparejan caso por caso frente a los márgenes que declaras. Una regla pasa solo cuando su intervalo supera el margen; un intervalo demasiado ancho para saberlo bloquea la publicación por evidencia insuficiente, con la evidencia guardada junto a la decisión.
Un resultado real
Página correcta en la posición 1
+6.2 puntos
[−36.3, +45.5] · 48 emparejadas · sin decidir
Página correcta entre las 3 primeras
+3.7 puntos
[−73.9, +76.2] · 27 emparejadas · sin decidir
Respuesta correcta
+6.5 puntos
[−39.4, +48.4] · 46 emparejadas · sin decidir
Leyendo las estimaciones puntuales, el reranker añadía 12,7 puntos de página correcta en la posición 1 y se habría publicado. Emparejados en las preguntas que ambos brazos respondieron, todos los intervalos cruzan el cero: este panel no puede decir si el reranker ayuda o perjudica, y Oloproof lo dice en lugar de elegir un ganador. Lee el informe de campo.