Volver HexScope Lens

2.961 respuestas de IA después: el ranking miente, la tasa de aparición aguanta

POINT Puntos clave
  • En 2.961 consultas de IA, la lista exacta se repite en menos del 1%
  • La solución: seguir la tasa de aparición y fijar el número de repeticiones

«Ayer decía A, hoy dice B» — y dejas de fiarte

Le preguntas a una IA qué marcas recomienda y hoy te da una respuesta, mañana otra.

Empresa A el lunes. Empresa B el martes.

Míralo pasar unas cuantas veces y la reacción honesta sale sola: si el ranking no se está quieto, ¿cómo mides nada?

Esa reacción es de las sanas. Pero que un ranking suelto oscile y que la medición sea inútil son dos cosas muy distintas.

Cambia la unidad que miras y aparece una señal que sí puedes guardar.

Hoy vamos a sacar esa señal de una observación de verdad grande: 2.961 intentos.

2.961 consultas después, el rango suelto casi nunca se repite

SparkToro y Gumshoe hicieron el experimento a lo grande: 600 personas, 2.961 consultas en total, solo para medir cuánto se mueven las recomendaciones.

El resultado es tajante.

  • La lista idéntica se repetía en menos del 1% de los casos.
  • El orden exacto coincidía solo en torno al 0,1%.

Así que reportar una pantalla de respuesta como «el ranking de este mes» es jugársela. Es tirar un dado una vez y decidir que ese dado favorece el 1. Sobre esta base, el ranking es sobre todo ruido.

Pero la tasa de aparición se mantenía estable y comparable

Aquí está lo que no puedes pasar por alto. En los mismos datos, la tasa de aparición aguantaba.

Una marca muy visible salía en el 97% de 71 intentos, por ejemplo. En cuanto preguntas «cada cuánto aparece» en lugar de «en qué puesto está», la reproducibilidad está ahí.

Y algo aún más curioso: incluso prompts que no se parecían en significado tendían a devolver conjuntos de marcas que se solapaban. Encaja limpiamente con Errica et al. (NAACL 2025), que muestran que la estructura del significado pesa más que la formulación de superficie.

Cambia el cómo lo dices y la respuesta aguanta; cambia el qué quieres decir y se mueve.

El partido de verdad es el diseño de medición, no comparar modelos

La trampa habitual, en la práctica, es arrancar por «qué modelo es más listo» y pasar de puntillas sobre las condiciones de medición.

Correr el mismo prompt de 60 a 100 veces o zanjarlo con menos de 10 cambia por completo cuánto puedes leer en los números.

Y otro punto clave: reportar no solo la media, sino también el a su alrededor. Dos marcas pueden parecer distintas cuando en realidad sus márgenes de error simplemente se solapan. Pasa más de lo que crees.

Conclusión: iguala las condiciones, no persigas el rango

Si sigues las recomendaciones de IA mes a mes, igualar tus condiciones de medición vale mucho más que sufrir con cada vaivén del rango.

Lo que 2.961 mediciones repetidas enseñan es esto: como las respuestas de la IA son ruidosas por naturaleza, hay que leer la tasa de aparición, no el rango suelto.

Así que cuando elijas una herramienta, comprueba si publica su número de repeticiones y la lógica con la que agrega la tasa de aparición. Lo mismo con tus informes internos: iguala el diseño de las preguntas, las condiciones de modelo y la ventana de agregación. Si eso se descuadra, ya no distingues una mejora real de un simple cambio en cómo mediste.

Y si quieres la foto completa de siete estudios relacionados, este repaso sobre «la tasa de aparición antes que el rango» es una buena puerta de entrada al resto.


Fuentes

  • Rand Fishkin (SparkToro/Gumshoe), “NEW Research: AIs are highly inconsistent when recommending brands or products; marketers should take care when tracking AI visibility”, 2026-01-27, sparktoro.com
  • Federico Errica, Giuseppe Siracusano, Davide Sanvito, Roberto Bifulco, “What Did I Do Wrong? Quantifying LLMs’ Sensitivity and Consistency to Prompt Engineering”, NAACL 2025, arXiv:2406.12334
Comparte este artículo
Bluesky X
Volver a los artículos