«Ma un’IA si ricorda davvero del nostro marchio?»
Capita in riunione, prima o poi. Qualcuno apre ChatGPT, chiede «che marchi consigli nel nostro settore?» e legge la risposta ad alta voce. Il vostro nome c’è. Piccola soddisfazione.
Poi la stessa domanda, rifatta il giorno dopo, restituisce un’altra lista. E stavolta il vostro nome non c’è. In quante riunioni sarà già andata esattamente così?
Ed ecco il dubbio, legittimo: se la risposta balla così, un’IA «si ricorda» davvero di noi? E soprattutto, come facciamo a saperlo?
La reazione istintiva è arrendersi: «se cambia sempre, non si misura». Tre ricerche dicono un’altra cosa. Messe in fila, indicano un segnale sorprendentemente stabile. Andiamo a vederle.
2.961 domande all’IA: la lista balla, ma la presenza no
Partiamo dall’esperimento più ampio sul tema, firmato SparkToro e Gumshoe (lo studio). Hanno arruolato 600 volontari e li hanno messi a interrogare ChatGPT, Claude e Google AI con 12 tipi di prompt, tra B2C e B2B, per un totale di 2.961 esecuzioni.
E i risultati? Guardando la lista di marchi restituita, la fotografia è impietosa.
- La lista identica, spiccicata, ricorreva meno dell’1% delle volte.
- L’ordine esatto combaciava solo nello 0,1% dei casi.
Detta così sembra la fine della misurazione: se la classifica è un lancio di dadi, cosa registriamo? Solo che dentro quel rumore c’era un numero che non si muoveva. Il (quante volte su N un marchio compare, a prescindere dalla posizione) restava statisticamente stabile. Un marchio ad alta visibilità si affacciava nel 97% di 71 esecuzioni; i marchi SaaS (i software venduti in abbonamento) oscillavano su tassi del 55–77%.
Ecco il primo ribaltamento. La posizione di un singolo giro è rumore, e inseguirla è tempo perso. Il quanto-spesso-compaio, invece, è un numero che si può mettere in un grafico e confrontare mese su mese.
Non è la parola esatta a contare, ma la categoria
C’è un dettaglio, nello stesso studio, che vale più di tutto il resto. I ricercatori hanno costruito 142 prompt apposta poco somiglianti tra loro: la similarità misurata era appena 0,081, cioè quasi nulla. Domande formulate in modi diversissimi, insomma.
E allora? Ci si aspetterebbe risposte sparate ai quattro venti. Invece le risposte convergevano su un insieme di marchi simile. La superficie della domanda cambiava, e la sostanza di chi finiva nominato restava la stessa.
La stessa lezione arriva, da un’altra strada, dal lavoro di Errica e colleghi (NAACL 2025), che hanno misurato quanto un LLM (i modelli linguistici dietro ChatGPT) reagisca quando si riformula la stessa domanda con parole diverse, chiamando le due misure «sensibilità» e «coerenza».
Il punto interessante è la dimensione dell’effetto: la variazione di accuratezza dovuta alla riformulazione restava tra il 3,2% e il 10%. Un po’ conta, certo. Ma non ribalta il tavolo.
Quindi la formulazione pesa poco; a pesare è la struttura di senso della domanda, la categoria e l’intenzione. Per un marchio la conseguenza è concreta: la memorabilità si costruisce occupando con chiarezza un ruolo di categoria riconoscibile.
Cosa rende «autentico» un profilo: la ricchezza del contesto
Un terzo studio arriva da un vicino inaspettato, la simulazione di persone. Park e colleghi, tra Stanford, Google DeepMind e altre due università (lo studio), hanno intervistato 1.052 persone e costruito, da ogni trascrizione, un agente IA che rispondesse come quella specifica persona.
Quanto erano fedeli questi cloni? Gli agenti hanno riprodotto l’85% delle risposte della persona reale al General Social Survey (una grande indagine sociale statunitense). E l’asticella non era mica morbida: quell’85% è misurato contro le risposte della stessa persona, tornata a rispondere due settimane dopo.
Attenzione a non tirare troppo l’analogia: riprodurre l’atteggiamento di un essere umano non è raccomandare un marchio, e i due piani vanno tenuti distinti. Ma un insegnamento si trasferisce. Quel «sembrare autentici» si reggeva sulla ricchezza del contesto dato in pasto al modello.
Ecco allora il filo che unisce le tre ricerche. Ciò che un’IA trattiene di stabile è il contesto coerente che le fonti le raccontano, al di là della superficie — la parola esatta, la posizione del giro. E questo, a differenza del ranking, si può costruire.
misurate la presenza, costruite un racconto di categoria coerente
Rimettendo in fila i tre studi, la domanda «l’IA si ricorda di noi?» smette di essere senza risposta. Cambia solo l’unità da guardare: non la posizione di un singolo giro, che balla, ma il tasso di presenza su domande ripetute con la stessa intenzione.
La prima mossa, allora, è di misura. Quando aprite uno strumento o preparate un report interno, ripetete la stessa domanda molte volte e leggete quante volte il marchio compare. Un numero costruito su qualche decina di ripetizioni vale; uno letto su un singolo screenshot, no.
La seconda mossa è di costruzione. Se ciò che l’IA trattiene è la categoria e non la parola, allora la memorabilità si coltiva tenendo coerente il racconto di categoria del marchio tra le fonti che l’IA legge: sito, schede, recensioni, terze parti. Un ruolo chiaro, ripetuto uguale ovunque, si sedimenta; dieci descrizioni diverse si annullano a vicenda.
Se volete approfondire come separare, nei cruscotti di AI Visibility, i numeri di cui fidarsi da quelli da maneggiare con le molle, questa guida sul «tasso di presenza» come misura del marchio nell’IA tira lo stesso filo dal lato della misura.
Fonti
- Rand Fishkin (SparkToro/Gumshoe), “NEW Research: AIs are highly inconsistent when recommending brands or products; marketers should take care when tracking AI visibility”, 2026-01-27, sparktoro.com
- Federico Errica, Giuseppe Siracusano, Davide Sanvito, Roberto Bifulco, “What Did I Do Wrong? Quantifying LLMs’ Sensitivity and Consistency to Prompt Engineering”, NAACL 2025, arXiv:2406.12334
- Joon Sung Park et al. (Stanford University / Northwestern University / University of Washington / Google DeepMind), “Generative Agent Simulations of 1,000 People”, arXiv:2411.10109v1 (versione 1, 15 novembre 2024), arXiv (questo articolo cita la versione 1; il lavoro è stato rititolato nella v3 del 28 giugno 2026, che riporta l’83% per gli agenti costruiti solo dalle interviste)