Rapport de terrain · notre propre exécution
Le reranker ressemblait à un gain. Les preuves ne permettaient pas de le dire.
Nous avons exécuté Oloproof contre un assistant de documentation à génération augmentée par récupération, en production, que nous n’exploitons pas : son propre moteur de récupération et son index, une vraie génération, un juge LLM et le panel de référence de 58 questions de ses responsables, inchangé. Aucun client n’est concerné. C’est notre exécution, rapportée telle que nous l’avons auditée.
- 58
- questions dans le panel de référence des responsables
- 0 sur 76
- comparaisons de feature flags tranchées
- 1 sur 9
- cas qui changent de verdict entre des exécutions identiques
- 15 sur 23
- réponses en échec récupérées avec le bon passage
Reranking activé contre reranking désactivé, 22 septembre 2026
| Métrique | Reranking activé | Reranking désactivé | Différence appariée, activé moins désactivé |
|---|---|---|---|
| Bonne page au rang 1 | 0.745 [0.519, 0.875] · 51 sur 58 | 0.618 [0.449, 0.760] · 55 sur 58 | +6.2 points [−36.3, +45.5] · 48 appariées |
| Bonne page dans le top 3 | 0.742 [0.270, 0.939] · 31 sur 58 | 0.683 [0.350, 0.875] · 41 sur 58 | +3.7 points [−73.9, +76.2] · 27 appariées |
| Réponse correcte (juge LLM) | 0.760 [0.519, 0.888] · 50 sur 58 | 0.685 [0.501, 0.819] · 54 sur 58 | +6.5 points [−39.4, +48.4] · 46 appariées |
Avant
L’assistant disposait déjà d’un bon harnais de test : un panel de référence, un juge LLM et une porte de publication. La porte comparait une estimation ponctuelle à une cible, quelle que soit la taille du panel. Lu ainsi, le reranker ajoutait 12,7 points de bonne page au rang 1 et aurait été livré. Et dans le score de fidélité qui conditionnait les publications, une réponse que le juge n’arrivait pas à noter comptait comme un échec total.
Après
Oloproof a apparié les deux bras sur les questions auxquelles les deux avaient répondu, a enregistré 4 erreurs serveur et 2 verdicts illisibles comme manquants, et a élargi chaque intervalle pour les encadrer. Les trois différences franchissent zéro, largement : ce panel ne peut pas dire si le reranker aide ou nuit.
Réexécuter les 23 réponses en échec avec le bon passage à la place du passage récupéré en a récupéré 15, à côté d’un témoin qui les réexécutait sans changement. Le diagnostic a étiqueté 5 ratés de récupération et 7 échecs de génération, en a laissé 11 non résolus, et a désigné la profondeur de récupération et la configuration de l’index comme les prochaines expériences.
Mesuré trois fois, environ un cas sur neuf a changé de verdict sans que rien ne change, et 13,8 % des appels ont renvoyé une erreur serveur. Déclarer ces erreurs transitoires a récupéré 18 des 22 cas manquants et resserré l’intervalle de 39 %. Un balayage des dix-neuf feature flags de l’assistant a ensuite donné 76 comparaisons appariées, aucune tranchée, et environ 40 questions de plus suffiraient à trancher les trois plus prometteuses.
« Une suite de 58 cas, dont un sur neuf répond différemment à chaque fois qu’on l’interroge, n’a pas quatre décimales de résolution. »
En bref
- Exécuté parOloproof, de sa propre initiative
- Système évaluéUn assistant de documentation RAG en production que nous n’exploitons pas
- Panel58 questions, celles des responsables, inchangées
- JugeUn juge LLM, pas encore vérifié par rapport à des annotations humaines
- Exécuté le22 et 23 septembre 2026
- Exécutions de suivi19 feature flags ; 24 conversations
Ce qu’il ne montre pas
Un système, un corpus et un panel trop petit pour trancher sa propre question. Le juge derrière chaque score de réponse n’a pas été validé par rapport à des personnes, et le diagnostic le dit. Le panel est à un seul tour : une exécution de suivi de 24 conversations a trouvé deux échecs reproductibles qu’un panel à un seul tour ne peut pas produire, dont un assistant qui niait ce qu’il avait dit un tour plus tôt. Ce n’est pas un benchmark, et ce n’est pas un client.