Skip to content

Rapporto sul campo · la nostra esecuzione

Il reranker sembrava un miglioramento. Le prove non potevano dirlo.

Abbiamo eseguito Oloproof contro un assistente di documentazione a generazione aumentata dal recupero, in produzione e che non gestiamo noi: il suo retriever e il suo indice, generazione reale, un giudice LLM e il panel di riferimento da 58 domande dei suoi responsabili, invariato. Nessun cliente è coinvolto. È la nostra esecuzione, riportata come l’abbiamo verificata.

58
domande nel panel di riferimento dei responsabili
0 su 76
confronti tra feature flag risolti
1 su 9
casi che cambiano verdetto tra esecuzioni identiche
15 su 23
risposte fallite recuperate con il passaggio corretto

Reranking attivo contro reranking disattivo, 22 settembre 2026

Il confronto del reranker: il tasso di ogni braccio con il suo intervallo al 95% e il conteggio osservato, e la differenza appaiata
MetricaReranking attivoReranking disattivoDifferenza appaiata, attivo meno disattivo
Pagina giusta in posizione 10.745 [0.519, 0.875] · 51 su 580.618 [0.449, 0.760] · 55 su 58+6.2 punti [−36.3, +45.5] · 48 appaiate
Pagina giusta tra le prime 30.742 [0.270, 0.939] · 31 su 580.683 [0.350, 0.875] · 41 su 58+3.7 punti [−73.9, +76.2] · 27 appaiate
Risposta corretta (giudice LLM)0.760 [0.519, 0.888] · 50 su 580.685 [0.501, 0.819] · 54 su 58+6.5 punti [−39.4, +48.4] · 46 appaiate

Prima

L’assistente aveva già un buon harness di test: un panel di riferimento, un giudice LLM e un gate di rilascio. Il gate confrontava una stima puntuale con un obiettivo, a qualunque dimensione del panel. Letto così, il reranker aggiungeva 12,7 punti di pagina giusta in posizione 1 e sarebbe stato rilasciato. E nel punteggio di fedeltà che decideva i rilasci, una risposta che il giudice non riusciva a valutare contava come un fallimento totale.

Dopo

Oloproof ha appaiato i due bracci sulle domande a cui entrambi avevano risposto, ha registrato 4 errori del server e 2 verdetti non interpretabili come mancanti e ha allargato ogni intervallo per includerli. Tutte e tre le differenze attraversano lo zero, e di molto: questo panel non può dire se il reranker aiuta o peggiora.

Rieseguire le 23 risposte fallite con il passaggio corretto al posto di quello recuperato ne ha recuperate 15, accanto a un controllo che le rieseguiva senza modifiche. La diagnosi ha etichettato 5 mancati recuperi e 7 fallimenti di generazione, ne ha lasciate 11 irrisolte e ha indicato la profondità di recupero e la configurazione dell’indice come i prossimi esperimenti.

Misurato tre volte, circa un caso su nove ha cambiato verdetto senza che nulla cambiasse, e il 13,8% delle chiamate ha restituito un errore del server. Dichiarare quegli errori come transitori ha recuperato 18 casi mancanti su 22 e ristretto l’intervallo del 39%. Una scansione dei diciannove feature flag dell’assistente ha poi dato 76 confronti appaiati, nessuno risolto, e circa 40 domande in più risolverebbero i tre più promettenti.

«Una suite di 58 casi, uno su nove dei quali risponde in modo diverso ogni volta che viene interrogato, non ha quattro cifre decimali di risoluzione.»
Dal rapporto di Oloproof sull’esecuzione, 23 settembre 2026

In sintesi

  • Eseguito daOloproof, di propria iniziativa
  • Sistema valutatoUn assistente di documentazione RAG in produzione che non gestiamo noi
  • Panel58 domande, quelle dei responsabili, invariate
  • GiudiceUn giudice LLM, non ancora verificato rispetto a etichette umane
  • Eseguito il22 e 23 settembre 2026
  • Esecuzioni successive19 feature flag; 24 conversazioni

Che cosa non mostra

Un sistema, un corpus e un panel troppo piccolo per risolvere la propria domanda. Il giudice dietro ogni punteggio di risposta non è stato convalidato rispetto a persone, e la diagnosi lo dice. Il panel è a turno singolo: un’esecuzione successiva di 24 conversazioni ha trovato due fallimenti riproducibili che i panel a turno singolo non possono produrre, tra cui un assistente che negava ciò che aveva detto un turno prima. Non è un benchmark, e non è un cliente.