«Questa cosa sul nostro sito non l’abbiamo mai scritta»
Chiedete a un’IA una ricerca approfondita sulla vostra azienda e vi torna indietro un rapporto ordinato, con l’elenco delle fonti in fondo. Fra quelle fonti ci sono anche le vostre pagine.
Nel testo, però, il marchio dice cose che sul vostro sito non stanno da nessuna parte. Il link agganciato lì a dimostrarle porta dritto a casa vostra.
Un link l’avete aperto, immagino. La pagina si è aperta per davvero, l’argomento era quello giusto, e il secondo è rimasto dov’era.
Il controllo, di solito, finisce lì.
Una misurazione uscita a maggio quei link li ha smistati in tre strati, e mi ha fatto ricontare le colonne del report mensile.
Quante delle fonti citate dall’IA confermano davvero quello che il rapporto scrive?
Il link si apre in oltre il 94% dei casi, e in più dell’80% la pagina che si apre parla proprio dell’argomento della frase. Che poi quella pagina confermi come fatto la frase a cui sta agganciata succede, sui modelli di punta, fra il 39% e il 77% delle volte.
A misurarlo sono stati in sei, dentro PricewaterhouseCoopers, e il lavoro è uscito il 7 maggio 2026 (lo trovate qui). Quattordici modelli di IA, 130 richieste di ricerca, e tutte le citazioni finite nei rapporti riaperte una per una; le richieste vengono da due raccolte pubbliche di domande, in inglese.
La ricerca approfondita, in pratica, è la modalità in cui l’IA si legge da sola decine o centinaia di pagine e vi consegna un rapporto con i link delle fonti: è il momento in cui ChatGPT o Gemini vanno «a fondo» prima di rispondervi.
I voti non li ha dati una redazione di persone: li ha dati un’IA che segue una griglia di valutazione, tarata su 50-100 controlli fatti a mano. Nessuno ha riletto tutte le citazioni a occhio.
Il report della visibilità conta lo strato più esterno
Una frase del rapporto, un link agganciato sotto. La misurazione lo guarda in tre punti diversi:
- il link si apre;
- la pagina parla dell’argomento di quella frase;
- la pagina conferma come fatto quella frase.
Il numero che nel report mensile sta accanto alla voce «citazioni» arriva al primo punto, e nella migliore delle ipotesi anche al secondo. Il terzo strato è l’unico che guarda che cosa è stato detto di voi: i primi due potete accumularli quanto volete, da lì il terzo non si vede.
È la nota a piè di pagina che rimanda a un libro esistente, pure sull’argomento giusto, e alla pagina indicata quella frase non c’è.
Il vostro conteggio delle citazioni, fino a quale dei tre strati è arrivato?
Alzando le ricerche da 2 a 150, si muove solo il terzo strato
Cercare di più vuol dire capire meglio?
La seconda parte del lavoro cambia una cosa sola: quanto il modello può cercare prima di scrivere. Si va da 2 ricerche fino a 150, con i tre strati misurati a ogni passo.
Il riscontro nei fatti è sceso: sui due modelli seguiti in questa prova, in media di circa 42 punti percentuali. GPT-5.4 passa dal 79% al 17%, Claude Opus 4.6 dall’80% al 58% (due modelli, due cadute di taglia diversa).
Che scavando più a fondo il modello capisse meglio, lo davo per scontato anch’io.
Nella stessa prova i link hanno continuato ad aprirsi e le pagine hanno continuato a stare sul tema: sopra il 92% a qualunque profondità. A scendere è stato soltanto il terzo strato.
Su quanto a fondo legge l’IA, leve non ne avete. Su come è scritta la frase che si porterà via, sì.
Che scriverla in un modo o nell’altro cambi il riscontro, il lavoro non l’ha misurato. Una frase che si regge da sola, intanto, porta dentro di sé tre informazioni:
- il numero («+32%»);
- il periodo a cui si riferisce («agosto 2026»);
- il termine di paragone («rispetto allo stesso mese dell’anno prima»).
«Ad agosto 2026 le spedizioni sono cresciute del 32% rispetto allo stesso mese dell’anno prima»: staccata dal resto, questa frase dice ancora la stessa cosa. «L’anno scorso siamo cresciuti parecchio» ha bisogno dei paragrafi intorno, e quando l’IA se la porta via i paragrafi restano a casa.
Che cosa di questa misurazione vale anche per voi
Il perimetro sono i rapporti prodotti dalla ricerca approfondita. La risposta che ChatGPT vi dà in chat, quella di tutti i giorni, sta fuori dalla misura.
Le 130 richieste vengono da due raccolte pubbliche in inglese. In italiano non è stata posta nemmeno una domanda, quindi da qui non si sa se nella nostra lingua i tre strati si comportino allo stesso modo.
Chi firma conta: PricewaterhouseCoopers è uno studio di contabilità e consulenza che vende anche assistenza sull’adozione dell’IA. Il lavoro, inoltre, è un preprint, cioè è stato pubblicato prima di passare dalla revisione tra pari.
I modelli sono quattordici versioni, quelle in circolazione quando la prova è stata fatta. Gli autori stessi mettono fra i limiti che le citazioni sul web invecchiano: il link sparisce, oppure la pagina cambia contenuto.
Che cosa resta in mano, allora? Il 39-77% resta un numero loro, misurato alle loro condizioni. Io mi tengo l’impianto: tre strati, contati separati.
aprite dieci citazioni prese a caso e segnate quante reggono
Dieci bastano. Dal conteggio delle citazioni di questo mese tiratene fuori dieci a caso e apritele una alla volta.
A caso per davvero: se aprite quelle che vi saltano all’occhio, in mano vi restano le citazioni che fanno bella figura.
Mettete poi quello che c’è scritto di voi accanto a quello che sta sulle vostre pagine, e segnate quante combaciavano. Quel numero non è quante volte il link si apriva, e nemmeno quante volte l’argomento era giusto: è il terzo strato, misurato con le vostre mani.
Nel mese in cui le citazioni crescono, cresce anche la parte che vi descrive per come siete? Il conteggio da solo questa domanda non la sente nemmeno, e intanto è su quel conteggio che si firmano i budget.
Se il conteggio l’avete già spaccato in due colonne, le volte che vi nominano e le volte che vi citano (lo abbiamo raccontato qui), questa è la terza: si riempie a mano, dieci righe alla volta.
Fonti
- Onweller, H. et al. (Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S.), “Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents”, arXiv:2605.06635, 7 maggio 2026 (limiti: è un preprint, non ancora passato dalla revisione tra pari; la misura riguarda le citazioni dei rapporti prodotti dalla ricerca approfondita, non le risposte normali in chat; le 130 richieste vengono da due raccolte pubbliche di domande in inglese e non contengono domande in italiano; PricewaterhouseCoopers è uno studio di contabilità e consulenza che vende anche assistenza sull’adozione dell’IA; i modelli sono quattordici versioni valutate in quel momento; gli autori indicano fra i limiti che le citazioni sul web spariscono o cambiano contenuto col tempo)