Skip to content

Informe de campo · nuestra propia ejecución

El reranker parecía una mejora. La evidencia no podía decirlo.

Ejecutamos Oloproof contra un asistente de documentación con generación aumentada por recuperación, en producción y que no operamos: su propio recuperador e índice, generación real, un juez LLM y el panel de referencia de 58 preguntas de sus responsables, sin cambios. No hay ningún cliente involucrado. Es nuestra ejecución, contada tal como la auditamos.

58
preguntas en el panel de referencia de los responsables
0 de 76
comparaciones de feature flags resueltas
1 de cada 9
casos que cambian de veredicto entre ejecuciones idénticas
15 de 23
respuestas fallidas recuperadas con el pasaje correcto

Con reranking frente a sin reranking, 22 de septiembre de 2026

La comparación del reranker: la tasa de cada brazo con su intervalo del 95 % y el recuento observado, y la diferencia emparejada
MétricaCon rerankingSin rerankingDiferencia emparejada, con menos sin
Página correcta en la posición 10.745 [0.519, 0.875] · 51 de 580.618 [0.449, 0.760] · 55 de 58+6.2 puntos [−36.3, +45.5] · 48 emparejadas
Página correcta entre las 3 primeras0.742 [0.270, 0.939] · 31 de 580.683 [0.350, 0.875] · 41 de 58+3.7 puntos [−73.9, +76.2] · 27 emparejadas
Respuesta correcta (juez LLM)0.760 [0.519, 0.888] · 50 de 580.685 [0.501, 0.819] · 54 de 58+6.5 puntos [−39.4, +48.4] · 46 emparejadas

Antes

El asistente ya tenía un buen arnés de pruebas: un panel de referencia, un juez LLM y un gate de publicación. El gate comparaba una estimación puntual con un objetivo, con cualquier tamaño de panel. Leído así, el reranker añadía 12,7 puntos de página correcta en la posición 1 y se habría publicado. Y en la puntuación de fidelidad que decidía las publicaciones, una respuesta que el juez no lograba calificar contaba como un fallo total.

Después

Oloproof emparejó los dos brazos en las preguntas que ambos habían respondido, registró 4 errores de servidor y 2 veredictos ilegibles como faltantes, y amplió cada intervalo para acotarlos. Las tres diferencias cruzan el cero, y con holgura: este panel no puede decir si el reranker ayuda o perjudica.

Volver a ejecutar las 23 respuestas fallidas con el pasaje correcto en lugar del recuperado recuperó 15, junto a un control que las volvió a ejecutar sin cambios. El diagnóstico etiquetó 5 fallos de recuperación y 7 fallos de generación, dejó 11 sin resolver y señaló la profundidad de recuperación y la configuración del índice como los siguientes experimentos.

Medido tres veces, aproximadamente uno de cada nueve casos cambió de veredicto sin que nada cambiara, y el 13,8 % de las llamadas devolvió un error de servidor. Declarar esos errores como transitorios recuperó 18 de 22 casos faltantes y estrechó el intervalo un 39 %. Un barrido de los diecinueve feature flags del asistente dio luego 76 comparaciones emparejadas, ninguna resuelta, y unas 40 preguntas más resolverían las tres más prometedoras.

«Una suite de 58 casos, uno de cada nueve de los cuales responde distinto cada vez que se le pregunta, no tiene cuatro decimales de resolución».
Del informe de Oloproof sobre la ejecución, 23 de septiembre de 2026

De un vistazo

  • Ejecutado porOloproof, por iniciativa propia
  • Sistema evaluadoUn asistente de documentación RAG en producción que no operamos
  • Panel58 preguntas, las de sus responsables, sin cambios
  • JuezUn juez LLM, aún no contrastado con etiquetas humanas
  • Ejecutado el22 y 23 de septiembre de 2026
  • Ejecuciones de seguimiento19 feature flags; 24 conversaciones

Lo que no muestra

Un sistema, un corpus y un panel demasiado pequeño para resolver su propia pregunta. El juez detrás de cada puntuación de respuesta no se ha validado con personas, y el diagnóstico lo dice. El panel es de un solo turno: una ejecución de seguimiento con 24 conversaciones encontró dos fallos reproducibles que un panel de un solo turno no puede producir, entre ellos un asistente que negaba lo que había dicho un turno antes. No es un benchmark, y no es un cliente.