Volver HexScope Lens

ChatGPT y Claude nombran marcas distintas, pero coinciden en por qué te descartan

POINT Puntos clave
  • Las recomendaciones difieren en dos tercios; el diagnóstico coincide un 95%
  • Antes de separar el plan por proveedor, diagnostica en qué fase pierdes

«¿Entonces hacemos dos planes, uno para ChatGPT y otro para Claude?»

En cuanto se pone sobre la mesa el trabajo de visibilidad en IA, la pregunta aparece. Siempre.

Hex-ko estuvo medio año atascada ahí. Abres el panel de medición y las marcas que nombra ChatGPT no son las que nombra Claude. Sin más.

Con esa diferencia en los resultados, separar el plan parece lo honesto. También duplica el trabajo, que es la parte incómoda.

Alguien midió justo eso, pero no por el lado de las recomendaciones, sino por el lado de los motivos por los que una marca se queda fuera.

¿Hay que separar la estrategia de visibilidad para ChatGPT y para Claude?

No antes de diagnosticar. Las marcas que recomienda cada proveedor difieren en unos dos tercios de los casos, pero cuando ambos dejan fuera a una marca, el diagnóstico del porqué coincide un 95,1% (Will Jack y equipo, Unusual.ai, mayo de 2026, 215 prompts comerciales y 7.763 fallos conjuntos).

Es decir: un diagnóstico, hecho una vez, sirve para los dos.

Diagnosticar aquí significa ordenar tu problema en una fase: la IA no te encuentra, o te encuentra y no le resultas atractiva, o directamente te ha archivado en otra categoría. El equipo clasificó cada fallo conjunto en esas tres modalidades.

215 prompts comerciales y 7.763 casos en los que ninguno de los dos te sacó

El equipo de Unusual.ai fue a por una bifurcación práctica: si tus clientes usan ChatGPT y Claude, ¿conviene optimizar por proveedor (arXiv:2606.26116)?

El método es sencillo. Lanzar 215 prompts de contexto comercial a ambos, alinear las recomendaciones y quedarse con los 7.763 «fallos conjuntos», aquellos en los que ninguno recomendó la marca, para ver si el diagnóstico coincide.

La divergencia se fija primero con números. La similitud de Jaccard entre proveedores es 0,35, mientras que repetir el mismo prompt en el mismo proveedor da entre 0,50 y 0,61. La diferencia entre proveedores es mayor que la variación de repetir la misma pregunta.

Cuanto menos conocida es la marca, más coinciden los diagnósticos

La coincidencia global es del 95,1%, con intervalo de confianza entre 94,3% y 95,7%. El desglose es lo interesante.

  • Marcas líderes de categoría: 81%
  • Marcas de cola larga y regionales: 99,6%

Cuanto más desconocida es la marca, más cae por el mismo motivo en ambos modelos. Al revés: cuando ya tienes nombre, tus formas de fallar empiezan a separarse por proveedor.

Eso te dice cuánto dura el atajo. Mientras aún estés construyendo notoriedad, un solo diagnóstico cubre a los dos.

Resultados distintos y diagnóstico común, porque los caminos son distintos

Los dos proveedores llegan a la recomendación por rutas visiblemente diferentes. Anthropic responde desde lo que ya sabe entre un 43% y un 52% de las veces; OpenAI, entre un 8% y un 29%.

Uno tira de memoria y el otro sale a buscar. Dos caminos para la misma pregunta, así que es normal que los nombres no cuadren.

Y sin embargo el motivo del tropiezo se repite. Dos personas con trayectos de casa al trabajo completamente distintos pueden llegar tarde por lo mismo: ninguna de las dos salió de casa.

Si no has salido de casa, optimizar dos rutas no arregla nada.

Hasta dónde llega este número

Cuatro reservas, y las diría todas antes de meter el dato en una presentación.

  • Solo dos proveedores, OpenAI y Anthropic. Gemini y Perplexity no entran
  • Mercados de EE. UU., Reino Unido y UE, 19 sectores. No hay medición en español
  • Medición de un único día, sin analizar la deriva en el tiempo
  • Los cuatro autores trabajan en Unusual.ai, empresa que vende medición de visibilidad de marca en IA

Lo último afecta a la dirección de la conclusión: «tu diagnóstico es reutilizable» le viene de perlas a quien vende diagnósticos.

Dicho eso, no contradice la divergencia de resultados de la que ya hemos escrito. Lo que difiere es la salida; la clasificación de las causas es la parte compartida.

diagnostica la fase antes de separar el plan

Lo que hay que llevarse es el orden.

Antes de montar la tabla de acciones por proveedor, mete un paso. Averigua si pierdes en el descubrimiento, cuando el modelo ni te saca, o en la selección, cuando te saca y elige a otro.

Esa respuesta se sostiene entre OpenAI y Anthropic con un 95% de fiabilidad. Y cuanto menos asentada esté tu marca, más se sostiene.

Separar el plan o no es una pregunta legítima. Solo que toca hacerla después del diagnóstico, no antes.


Fuentes

  • Will Jack, Noah Lehman, Keller Maloney, Sarah Xu (Unusual.ai), “Divergent Recommendations, Convergent Diagnoses: Cross-Provider Failure-Mode Convergence in AI Commercial Recommendation”, arXiv:2606.26116v1, publicado el 22 de mayo de 2026, arxiv.org (215 prompts comerciales en OpenAI y Anthropic; 7.763 fallos conjuntos analizados. Similitud de Jaccard entre proveedores 0,35 frente a una línea base de 0,50-0,61 al repetir el mismo prompt en el mismo proveedor. El diagnóstico de la modalidad de fallo coincidió en el 95,1% [94,3%, 95,7%], desde el 81% en líderes de categoría hasta el 99,6% en marcas de cola larga y regionales. Anthropic recomendó desde conocimiento previo en el 43-52% de las ejecuciones y OpenAI en el 8-29%. Mercados de EE. UU., Reino Unido y UE, 19 sectores, medición de un solo día; los cuatro autores están empleados por Unusual.ai, proveedor de medición de visibilidad de marca en IA.)
Comparte este artículo
Bluesky X
Volver a los artículos