Indietro HexScope Lens

Le vere domande a ChatGPT: la storia di uno studio su centinaia di prompt

POINT Punti chiave
  • Le domande vere: il 71% più lunghe di quelle stimate
  • Misurare solo con «qual è il migliore» inganna

«Qual è il miglior CRM?»: ma qualcuno lo chiede davvero così?

Quando si misura la visibilità di un marchio nell’IA, la lista dei prompt somiglia quasi sempre a questa: «miglior CRM», «migliori strumenti di project management». Corta, pulita, comoda da confrontare.

Capita anche a me: è la cosa più facile da standardizzare.

Però pensate all’ultima volta che avete chiesto un consiglio a ChatGPT. Due parole? Macché. Un paragrafo intero: quante persone siete, che budget c’è, più quella condizione strana imposta dal capo.

E qui nasce il problema: se le domande vere sono fatte così, misurare solo con «qual è il migliore» vuol dire misurare una conversazione che quasi non esiste. Quanto è grande lo scarto? Andiamo a vedere.

Le domande vere sono il 71% più lunghe (e molto più personali)

Thomas Peham di Otterly AI ha confrontato centinaia di prompt reali inviati a ChatGPT con i prompt stimati che gli strumenti di misurazione generano (l’analisi).

I numeri parlano chiaro:

  • Lunghezza media: 8,8 parole per i prompt stimati, 15,1 per quelli reali (il 71% in più)
  • Pronomi personali: nel 18,8% dei prompt stimati, nel 52,1% di quelli reali (2,8 volte)
  • Formulazioni orientate al problema: 7,1% contro 21,1% (il triplo)
  • Prima parola: i prompt stimati puntano quasi tutto su «best»; quelli reali partono da «what» e «I»

Insomma, gli utenti veri non chiedono mica una classifica. Descrivono una situazione: «siamo in cinque, questo è il budget, cosa ci conviene?». Più che una ricerca, è una consulenza.

Conta la parola o conta la domanda?

A questo punto verrebbe da pensare: basta sostituire «best» con «top» e siamo a posto. Sarà vero?

Uno studio presentato a NAACL 2025 da Errica e colleghi ha quantificato quanto cambia la precisione di un modello se si riformula la stessa domanda senza cambiarne il senso: tra il 3,2% e il 10% (lo studio). Si nota, ma la partita non si gioca lì.

La partita è nella struttura del significato. Chiedere una classifica o chiedere una decisione con condizioni sono due domande diverse, e il modello produce risposte di natura diversa.

E la seconda è proprio quella che gli utenti veri scrivono tutti i giorni.

Anche i prompt di test vanno controllati

C’è un terzo tassello. Il gruppo di Mburu ha studiato le domande da sondaggio generate dall’IA: veloci da produrre, ma inclini alla verbosità e alle (lo studio).

Che senso ha allora fidarsi ciecamente del questionario generato? Nessuno. Se si chiede a un’IA di «generare le domande tipiche dei clienti», escono quasi sempre domande corte e commerciali, esattamente la deriva che Otterly ha messo in cifre.

La soluzione non è smettere di generare prompt. È mescolarci apposta le domande lunghe, con condizioni, che il generatore da solo non produrrà.

Conclusione: basta misurare solo il «migliore», misurate la consulenza

Se il monitoraggio della visibilità nell’IA vive di soli prompt corti tipo «qual è il miglior X», si misura qualcosa di reale ma ristretto. Le domande dei compratori veri portano dentro persone, budget e vincoli.

Due mosse concrete. Prima: costruire la lista di prompt su due livelli, tenendo i «best» corti (si confrontano bene nel tempo) e aggiungendo consulenze con condizioni vere. Seconda: passare i contenuti allo stesso setaccio. Le vostre pagine sanno rispondere a «quale conviene in questa situazione», o elencano solo funzionalità?

Misurando entrambi i tipi si vede come l’IA tratta il marchio nel momento in cui la decisione si prende davvero.


Fonti

  • Thomas Peham (Otterly AI), “Real vs Estimated Prompts: I Analyzed 100s of Real ChatGPT Queries”, 2026-02-03, Otterly AI
  • Federico Errica, Giuseppe Siracusano, Davide Sanvito, Roberto Bifulco, “What Did I Do Wrong? Quantifying LLMs’ Sensitivity and Consistency to Prompt Engineering”, NAACL 2025, arXiv:2406.12334
  • Mburu, T. K., Rong, K., McColley, C. J., & Werth, A., “Methodological foundations for artificial intelligence-driven survey question generation”, Journal of Engineering Education, 114(3), e70012, 2025, DOI:10.1002/jee.70012
Condividi questo articolo
Bluesky X
Torna agli articoli