Volver HexScope Lens

¿La IA responde distinto cada vez por defecto suyo… o porque medimos mal?

POINT Puntos clave
  • Las listas de cada respuesta bailan, la tasa de aparición se mantiene estable
  • Buena parte de la inestabilidad medida nace del propio método de evaluación

«Le pregunto dos veces lo mismo y me dice cosas distintas»

Introduce la IA en cualquier empresa y la frase llega en la primera semana: «le hice la misma pregunta dos veces y me dio dos respuestas diferentes. ¿Cómo me voy a fiar?». Y es una reacción de lo más razonable.

A Hex-ko también le pasó: misma pregunta, otra formulación de vuelta, y esa sensación incómoda de suelo que se mueve.

Pero el problema es la conclusión. Saltar de «las respuestas varían» a «la IA no sirve» es ir demasiado rápido. Porque estudios recientes sugieren que parte de ese baile no es un defecto del modelo: lo infla la forma en que lo medimos.

Y hay quien lo ha comprobado en serio. Vamos a verlo.

La «sensibilidad al prompt» no mide solo al modelo

Primero, el concepto. La sensibilidad al prompt es, en una frase, cuánto cambia el resultado cuando reformulas la pregunta. Normalmente se trata como una debilidad del modelo, y punto.

El equipo de Hua (el estudio) fue un paso más allá: ¿y si parte de esa sensibilidad la estuviera fabricando el propio método de evaluación? Para comprobarlo evaluaron 7 grandes modelos de lenguaje en 6 benchmarks con 12 plantillas de pregunta, intentando separar el temblor del modelo del temblor del instrumento.

Es la pregunta obvia. Y casi nadie la había hecho.

Gran parte del baile es un artefacto de la medición

¿Y cuál fue el resultado? Una parte considerable de la sensibilidad observada podría ser un artefacto del método de evaluación. Es decir: las manías del termómetro hacen que la fiebre parezca más alta de lo que es.

Las evaluaciones clásicas suelen apoyarse en la puntuación por log-verosimilitud (mirar cómo se reparten las probabilidades) o en la coincidencia exacta de respuestas (el texto debe coincidir letra a letra). Fáciles de automatizar, sí. Pero descartan respuestas que significan lo mismo, como si «OK» y «sin problema» fueran dos opiniones distintas.

Por eso los autores repitieron la medición con un LLM como juez, evaluando al nivel del significado. El resultado: la varianza del rendimiento se redujo y el ranking de modelos se volvió más consistente. Ojo: esto no dice que «la IA sea estable». Dice que el temblor visible depende de qué aceptas como respuesta correcta.

Con marcas: las listas bailan, la tasa de aparición aguanta

Ahora, datos mucho más cercanos al marketing. En una investigación de SparkToro y Gumshoe, 600 voluntarios lanzaron peticiones de recomendación a ChatGPT, Claude y la IA de Google: 2.961 ejecuciones en total. Y los números van contra la intuición:

  • Menos del 1% de probabilidad de recibir dos veces la misma lista
  • Alrededor del 0,1% de recibirla además en el mismo orden
  • Una marca de alta visibilidad apareció en el 97% de sus 71 ejecuciones
  • Las grandes marcas mantienen una tasa de aparición (Visibility%) estable, entre el 55 y el 77%

El ranking de una respuesta suelta es casi azar. La tasa de aparición sobre la repetición es sorprendentemente estable.

Un detalle más: los 142 prompts escritos a mano por los participantes tenían una similitud semántica de solo 0,081 —cada uno preguntaba a su manera— y aun así las respuestas convergían en conjuntos de marcas muy parecidos. Las listas individuales tiemblan; la tendencia agregada acaba viéndose.

Conclusión: vigila la tasa de aparición, no el ranking de un día

¿Qué nos llevamos? El baile de las respuestas de IA a veces es real y a veces lo agranda el instrumento de medida. Por eso un ranking tomado una sola vez es un KPI peligroso: no distingue la suerte de la tendencia.

Para el trabajo de marketing, lo sólido es repetir preguntas con la misma intención y convertir la tasa de aparición en tu métrica principal, con una evaluación que acepte respuestas equivalentes en significado en lugar de exigir coincidencia exacta. Necesitaremos más estudios para saber hasta dónde se generaliza esto. Pero ya cambia la conversación: de «la IA baila, no sirve» a «el baile es un hecho: mide contando con él». Y esa segunda conversación sí te deja decidir.


Fuentes

  • Hua et al. (2025), “Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMs”, arXiv
  • Rand Fishkin (SparkToro/Gumshoe) (2026), “NEW Research: AIs are highly inconsistent when recommending brands or products”, SparkToro
Comparte este artículo
Bluesky X
Volver a los artículos