Skip to content

Rapport de terrain · notre propre exécution

Le reranker ressemblait à un gain. Les preuves ne permettaient pas de le dire.

Nous avons exécuté Oloproof contre un assistant de documentation à génération augmentée par récupération, en production, que nous n’exploitons pas : son propre moteur de récupération et son index, une vraie génération, un juge LLM et le panel de référence de 58 questions de ses responsables, inchangé. Aucun client n’est concerné. C’est notre exécution, rapportée telle que nous l’avons auditée.

58
questions dans le panel de référence des responsables
0 sur 76
comparaisons de feature flags tranchées
1 sur 9
cas qui changent de verdict entre des exécutions identiques
15 sur 23
réponses en échec récupérées avec le bon passage

Reranking activé contre reranking désactivé, 22 septembre 2026

La comparaison du reranker : le taux de chaque bras avec son intervalle à 95 % et le nombre observé, et la différence appariée
MétriqueReranking activéReranking désactivéDifférence appariée, activé moins désactivé
Bonne page au rang 10.745 [0.519, 0.875] · 51 sur 580.618 [0.449, 0.760] · 55 sur 58+6.2 points [−36.3, +45.5] · 48 appariées
Bonne page dans le top 30.742 [0.270, 0.939] · 31 sur 580.683 [0.350, 0.875] · 41 sur 58+3.7 points [−73.9, +76.2] · 27 appariées
Réponse correcte (juge LLM)0.760 [0.519, 0.888] · 50 sur 580.685 [0.501, 0.819] · 54 sur 58+6.5 points [−39.4, +48.4] · 46 appariées

Avant

L’assistant disposait déjà d’un bon harnais de test : un panel de référence, un juge LLM et une porte de publication. La porte comparait une estimation ponctuelle à une cible, quelle que soit la taille du panel. Lu ainsi, le reranker ajoutait 12,7 points de bonne page au rang 1 et aurait été livré. Et dans le score de fidélité qui conditionnait les publications, une réponse que le juge n’arrivait pas à noter comptait comme un échec total.

Après

Oloproof a apparié les deux bras sur les questions auxquelles les deux avaient répondu, a enregistré 4 erreurs serveur et 2 verdicts illisibles comme manquants, et a élargi chaque intervalle pour les encadrer. Les trois différences franchissent zéro, largement : ce panel ne peut pas dire si le reranker aide ou nuit.

Réexécuter les 23 réponses en échec avec le bon passage à la place du passage récupéré en a récupéré 15, à côté d’un témoin qui les réexécutait sans changement. Le diagnostic a étiqueté 5 ratés de récupération et 7 échecs de génération, en a laissé 11 non résolus, et a désigné la profondeur de récupération et la configuration de l’index comme les prochaines expériences.

Mesuré trois fois, environ un cas sur neuf a changé de verdict sans que rien ne change, et 13,8 % des appels ont renvoyé une erreur serveur. Déclarer ces erreurs transitoires a récupéré 18 des 22 cas manquants et resserré l’intervalle de 39 %. Un balayage des dix-neuf feature flags de l’assistant a ensuite donné 76 comparaisons appariées, aucune tranchée, et environ 40 questions de plus suffiraient à trancher les trois plus prometteuses.

« Une suite de 58 cas, dont un sur neuf répond différemment à chaque fois qu’on l’interroge, n’a pas quatre décimales de résolution. »
Extrait du rapport d’Oloproof sur l’exécution, 23 septembre 2026

En bref

  • Exécuté parOloproof, de sa propre initiative
  • Système évaluéUn assistant de documentation RAG en production que nous n’exploitons pas
  • Panel58 questions, celles des responsables, inchangées
  • JugeUn juge LLM, pas encore vérifié par rapport à des annotations humaines
  • Exécuté le22 et 23 septembre 2026
  • Exécutions de suivi19 feature flags ; 24 conversations

Ce qu’il ne montre pas

Un système, un corpus et un panel trop petit pour trancher sa propre question. Le juge derrière chaque score de réponse n’a pas été validé par rapport à des personnes, et le diagnostic le dit. Le panel est à un seul tour : une exécution de suivi de 24 conversations a trouvé deux échecs reproductibles qu’un panel à un seul tour ne peut pas produire, dont un assistant qui niait ce qu’il avait dit un tour plus tôt. Ce n’est pas un benchmark, et ce n’est pas un client.