Volver HexScope Lens

Cientos de preguntas reales a ChatGPT: la gente no pregunta como tú mides

POINT Puntos clave
  • Las preguntas reales, un 71% más largas que las estimadas
  • Medir solo con «mejor herramienta» se queda corto

«Mejor CRM del mercado»: ¿de verdad alguien pregunta así?

Si mides la visibilidad de tu marca en la IA, tu lista de prompts seguramente se parece a esto: «mejor CRM», «mejores herramientas de gestión de proyectos». Corta, limpia, de manual.

A Hex-ko también le pasó. Es lo más fácil de estandarizar.

Pero piensa en la última vez que tú le pediste una recomendación a ChatGPT. No escribiste dos palabras. Escribiste un párrafo entero, con el tamaño de tu equipo, tu presupuesto y esa condición rara que puso tu jefe.

Y ahí está el problema: si las preguntas reales son así, medir solo con «best» es medir una conversación que casi no existe. Un análisis reciente puso números a ese desfase. Vamos a verlos.

Las preguntas reales son un 71% más largas (y mucho más personales)

Thomas Peham, de Otterly AI, comparó cientos de prompts reales de ChatGPT con los prompts estimados que generan las herramientas de medición (análisis).

Las diferencias no son sutiles:

  • Longitud media: 8,8 palabras en los estimados, 15,1 en los reales (un 71% más)
  • Pronombres personales: 18,8% frente a 52,1% (2,8 veces más)
  • Lenguaje orientado a problemas: 7,1% frente a 21,1% (el triple)
  • Primera palabra: los estimados abusan de «best», mientras los reales empiezan por «what» y «I»

La gente no pide un ranking. Describe una situación. «Somos cinco, tenemos este presupuesto, ¿cuál nos conviene?» Eso ya no es una búsqueda: es una consulta.

Lo que pesa no es la palabra, es lo que estás preguntando

¿Y no bastaría con cambiar «best» por «top»? Pues no exactamente.

Un estudio presentado en NAACL 2025 por Errica y su equipo midió cuánto varía la precisión de un modelo al reformular la misma pregunta sin cambiar su sentido: entre un 3,2% y un 10% (estudio). Se nota, pero el partido no se juega ahí.

Se juega en la estructura del significado. La diferencia importante no está entre «best» y «top», sino entre pedir un ranking y pedir una decisión con condiciones. Son dos preguntas distintas, y el modelo devuelve respuestas de naturaleza distinta.

Y la segunda es justo la que los usuarios reales escriben cada día.

Ojo: los prompts generados por IA también se desvían

Hay un tercer dato que conviene tener delante. El equipo de Mburu estudió las preguntas de encuesta generadas por IA y encontró que, aunque se producen rápido, tienden a la verbosidad y a las (estudio).

Es decir: el propio cuestionario con el que mides también es material a revisar. Si le pides a una IA «genera preguntas típicas de clientes», las preguntas podrían salirte cortas y comerciales: justo el sesgo que Otterly detectó.

La solución no es dejar de generar prompts. Es mezclar a propósito las preguntas largas, con condiciones, que el generador no te va a dar solo.

Conclusión: no midas solo con «best», mete también la consulta

Si tu medición de visibilidad en IA vive solo de prompts tipo «mejor X», estás midiendo algo real pero estrecho. Las preguntas de los compradores reales llevan dentro equipo, presupuesto y restricciones.

Dos movimientos concretos. Primero, monta tu lista de prompts en dos capas: conserva los cortos tipo «best» (sirven para comparar en el tiempo) y añade consultas con condiciones reales. Segundo, revisa tu contenido con esa misma vara: ¿hay algo en tu web que responda a «cuál conviene en esta situación», o solo tienes listas de funcionalidades?

Midiendo los dos tipos de pregunta podrás ver cómo trata la IA a tu marca en el momento en que la decisión se toma de verdad. Y esa es la conversación que importa.


Fuentes

  • Thomas Peham (Otterly AI), “Real vs Estimated Prompts: I Analyzed 100s of Real ChatGPT Queries”, 2026-02-03, Otterly AI
  • Federico Errica, Giuseppe Siracusano, Davide Sanvito, Roberto Bifulco, “What Did I Do Wrong? Quantifying LLMs’ Sensitivity and Consistency to Prompt Engineering”, NAACL 2025, arXiv:2406.12334
  • Mburu, T. K., Rong, K., McColley, C. J., & Werth, A., “Methodological foundations for artificial intelligence-driven survey question generation”, Journal of Engineering Education, 114(3), e70012, 2025, DOI:10.1002/jee.70012
Comparte este artículo
Bluesky X
Volver a los artículos