Volver HexScope Lens

Una sola línea sobre quién pregunta cambia las marcas que recomienda la IA

POINT Puntos clave
  • Nombrar al comprador cambia hasta el 75% de las marcas del medio
  • 2.000 ejecuciones con 10 perfiles, 8 preguntas y 3 configuraciones de modelo

«Ese dato, ¿quién lo estaba preguntando?»

Has sacado tú el número, y aun así no sabes defenderlo en cuanto alguien insiste un poco.

En qué porcentaje de preguntas sale tu nombre: eso lo puedes enseñar. Cuánto se ha movido desde el mes pasado: también. Dos números reales.

Pero en cuanto te preguntan quién hacía esa pregunta, el suelo se ablanda.

A Hex-ko la hipótesis le duró años: mismo texto, mismas condiciones. Mismas palabras de entrada, mismo terreno de juego.

Pero alguien puso delante una línea sobre quién preguntaba, y volvieron otras marcas. Lo hizo 2.000 veces, así que vamos a ver qué se movió.

¿La IA recomienda según quién pregunte?

Sí. Con la pregunta idéntica palabra por palabra, si delante le pones «eres el dueño de una pyme británica», el solapamiento entre las dos listas de marcas cae entre 0,12 y 0,20 puntos.

Lo que se movió fue la franja intermedia. Las marcas de mercado medio llegaron a renovar hasta el 75% de sus nombres al cambiar de perfil, mientras que las líderes de categoría conservaban en torno al 80% de los suyos preguntara quien preguntara.

El trabajo es un preprint —un artículo colgado antes de pasar la revisión por pares— de Will Jack, Noah Lehman, Keller Maloney y Sarah Xu, del equipo de Unusual.ai, subido a arXiv el 28 de mayo de 2026 (el estudio).

Lo midieron sobre chats comerciales que responden apoyándose en resultados de búsqueda externos. Diez perfiles × ocho preguntas × tres configuraciones de modelo × diez repeticiones: 2.000 ejecuciones en total.

Un perfil (persona) aquí es una línea de contexto: quien pregunta es una persona de este tipo. Montaron diez a mano combinando sector, tamaño de empresa, cargo y país — un fundador en solitario en Estados Unidos, un responsable de compras de una gran empresa, el dueño de una pyme británica, y siete más por el estilo.

En la franja media hay sillas libres

La notoriedad de la marca es lo que decide cuánto pesa el perfil. Por eso el estudio ordena las marcas por lo conocidas que son, y publica qué porcentaje de cada franja se renovaba al cambiar de perfil.

En las tres configuraciones de modelo, los rangos salieron así:

  • Líderes de categoría: 20-29%
  • Mercado medio: 39-75%
  • Actores regionales: 27-33%

A la líder la nombran para todo el mundo, así que su asiento está atornillado. Pero en la franja media los asientos se vacían y se vuelven a llenar cada vez que cambia quien pregunta: 39% en la configuración más estable, 75% en la que más se mueve.

¿Preguntas dos veces y te repiten?

La medida de solapamiento que usaron es el índice de Jaccard, que puntúa de 0 a 1 cuánto tienen en común dos listas: cuanto más cerca del 1, más coinciden las marcas.

Entre perfiles distintos, ese solapamiento se quedó en 0,22-0,35. Pero es que repitiendo la misma pregunta con el mismo perfil subía solo hasta 0,42-0,51.

Es decir: la misma persona preguntando lo mismo recibe una lista casi medio distinta cada vez. Y el efecto del perfil se monta encima de eso.

¿Qué queda entonces de un «este mes salimos entre las recomendadas» medido una sola vez? Más o menos lo mismo que sacar el carácter de alguien de una partida de piedra, papel o tijera. De hecho, si tu marca no es la líder del sector, entrar y salir de la lista cada mes podría ser la estructura del fenómeno y no el ruido de tu medición.

A Hex-ko le parece que el orden importa: primero repetir, después separar por perfiles. Si falta una de las dos cosas, la diferencia no se lee.

¿Hasta dónde llega todo esto?

Todos los autores del estudio trabajan en Unusual.ai, una empresa de visibilidad de marca en IA, y la conclusión «hay que medir por perfiles» le viene de perlas. Y hay cinco cosas más que marcan hasta dónde llegan estos números.

  • No consta el estado de revisión por pares: es un preprint
  • Diez perfiles hechos a mano, solo en inglés y concentrados en Estados Unidos, Reino Unido y la UE
  • Se midió en un único día, así que la variación entre días queda sin evaluar
  • La franja de marcas especialistas de cola larga se quedó sin muestra suficiente en todas las condiciones (menos de 30 casos por celda) y no da ninguna cifra
  • La configuración de Anthropic solo cubre 4 de las 8 preguntas

Y de causalidad, nada. Lo que se puede decir llega hasta «al cambiar quién pregunta, cambió el resultado». Pero lo de «escribe un perfil y te llevas la recomendación» no lo dice el estudio en ningún momento.

Los dos proveedores tampoco se portaron igual. El modelo de Anthropic se movía más con el perfil (esa caída de 0,20) y entre el 43% y el 52% de sus recomendaciones no estaban enganchadas a ningún resultado de búsqueda. En las configuraciones de OpenAI esa proporción se queda en el 8-29%.

Los autores lo atribuyen a cuánto se apoya cada respuesta en el conocimiento del entrenamiento en lugar de en la búsqueda, y reconocen que el mecanismo sigue sin estar cerrado. A Hex-ko le sirve como motivo para medir cada IA por separado. Pero la realidad es que, con un solo día de mediciones, podría estar pidiéndole al dato más de lo que aguanta.

lanza la misma pregunta como dos o tres de tus clientes

Resumida en una sola curva, la visibilidad en IA aplasta contra la media todo ese movimiento entre perfiles. Y en una marca de mercado medio, debajo de esa media hay muchísimo trasiego de sillas.

Lo primero que cambias es solo la forma de lanzar la pregunta. Escribe dos o tres de tus tipos de cliente principales, manda tu pregunta de siempre con cada uno de ellos por delante, y pon los resultados uno al lado del otro.

Pero no los promedies: la franja con asientos libres y la franja con asientos ocupados se compensan entre sí. Separados, por fin se ve en la respuesta de qué cliente falta tu nombre.

¿Quién estaba preguntando cuando salió este número? Es la etiqueta que a Hex-ko le gustaría leer en el gráfico antes de leer el gráfico.


Fuentes

  • Will Jack, Noah Lehman, Keller Maloney, Sarah Xu (Unusual.ai), «Persona Conditioning of Brand Recommendations in Retrieval-Augmented Commercial Chat: A Prominence-Stratified Cross-Provider Audit», arXiv preprint 2605.30207v1, 28 de mayo de 2026, arxiv.org (diseño factorial de 10 perfiles × 8 preguntas × 3 configuraciones de modelo × 10 repeticiones = 2.000 ejecuciones. Las configuraciones son GPT-5.4-mini con esfuerzo de razonamiento bajo y alto, más Claude-sonnet-4.6 con esfuerzo bajo. Anteponer el perfil baja la similitud de Jaccard del conjunto recomendado en −0,12 [intervalo al 95% −0,153, −0,091], −0,16 [−0,194, −0,139] y −0,20 [−0,263, −0,156], y ninguno de los tres intervalos incluye el cero. Entre perfiles distintos la similitud va de 0,22 a 0,35; dentro del mismo perfil, de 0,42 a 0,51. Rotación de las recomendaciones por franja de notoriedad: líderes de categoría 23%/29%/20%, aspirantes consolidados 5%/13%/23%, mercado medio 75%/67%/39%, actores regionales 27%/33%/—. En palabras del propio resumen, los líderes de categoría mantienen alrededor del 80% de coincidencia y en el mercado medio se renueva hasta el 75%. Las recomendaciones que no se apoyan en una fuente recuperada suponen entre el 43% y el 52% en Anthropic, y entre el 8% y el 29% en OpenAI. Límites: los cuatro autores trabajan en Unusual.ai, una empresa de visibilidad en IA con interés comercial en esta conclusión; no se indica si el trabajo ha pasado la revisión por pares; la franja de cola larga se queda sin muestra suficiente en todas las celdas, con menos de 30 apariciones de marca por celda; las celdas de sonnet solo cubren 4 de las 8 preguntas; los perfiles son 10 redactados a mano, solo en inglés y concentrados en EE. UU., Reino Unido y la UE; no se ha probado variar la redacción del preámbulo; la medición es de un solo día, así que no evalúa la deriva en el tiempo; y la explicación que proponen los autores —que el perfil actúa sobre la generación a partir del conocimiento previo y no sobre la recuperación— sigue sin confirmar)
Comparte este artículo
Bluesky X
Volver a los artículos