Retour HexScope Lens

ChatGPT et Claude citent des marques différentes, mais s'accordent à 95 % sur le pourquoi

POINT Points clés
  • Les recommandations divergent aux deux tiers, le diagnostic converge à 95 %
  • Diagnostiquer l'étape où vous perdez avant de dédoubler le plan

« On fait deux plans, un pour ChatGPT et un pour Claude ? »

Dès qu’on pose le chantier visibilité IA sur la table, la question arrive. À tous les coups.

Hex-ko est restée coincée dessus pendant six bons mois. On ouvre le tableau de mesure, et les marques que cite ChatGPT ne sont tout simplement pas celles que cite Claude.

Avec des résultats qui divergent à ce point, dédoubler le plan paraît honnête. Cela double aussi la charge de travail.

Quelqu’un a mesuré précisément ça — pas du côté des recommandations, mais du côté des raisons pour lesquelles une marque n’en obtient aucune.

Faut-il séparer la stratégie de visibilité IA entre ChatGPT et Claude ?

Pas avant d’avoir diagnostiqué. Les marques recommandées par les deux fournisseurs divergent dans environ deux tiers des cas, mais quand tous deux écartent une marque, le diagnostic du pourquoi concorde à 95,1 % (Will Jack et son équipe, Unusual.ai, mai 2026, 215 requêtes commerciales, 7 763 échecs conjoints).

Autrement dit : un diagnostic, posé une fois, vaut pour les deux.

Diagnostiquer, ici, veut dire ranger votre problème dans une étape. Le modèle ne vous trouve pas, ou il vous trouve et vous ne convainquez pas, ou il vous a classée dans un tout autre usage. L’équipe a trié chaque échec conjoint selon ces trois modes.

215 requêtes commerciales, 7 763 cas où aucun des deux ne vous a citée

L’équipe d’Unusual.ai s’est attaquée à une bifurcation concrète : si vos clients utilisent les deux, faut-il optimiser fournisseur par fournisseur (arXiv:2606.26116) ?

La méthode est sobre. Envoyer 215 requêtes de contexte commercial aux deux, aligner les recommandations, puis extraire les 7 763 « échecs conjoints » — les passages où ni l’un ni l’autre n’a recommandé la marque — et vérifier si le diagnostic concorde.

La divergence est d’abord chiffrée. La similarité de Jaccard entre fournisseurs s’établit à 0,35, alors que relancer la même requête chez le même fournisseur donne 0,50 à 0,61. L’écart entre fournisseurs dépasse la variation d’une simple relance.

Moins la marque est connue, plus les diagnostics se rejoignent

Concordance globale : 95,1 %, intervalle de confiance de 94,3 % à 95,7 %. Le détail en dessous est ce qui sert.

  • Marques leaders de catégorie : 81 %
  • Marques de longue traîne et régionales : 99,6 %

Plus la marque est obscure, plus les deux modèles l’écartent pour le même motif. À l’inverse, quand vous avez déjà un nom, vos manières d’échouer commencent à se séparer selon le fournisseur.

Cela indique la durée du raccourci. Tant que vous construisez encore votre notoriété, un seul diagnostic couvre les deux.

Des résultats différents, un diagnostic commun, parce que les chemins diffèrent

Les deux arrivent à la recommandation par des routes visiblement distinctes. Anthropic répond depuis ce qu’il sait déjà dans 43 à 52 % des cas ; OpenAI dans 8 à 29 %.

L’un puise dans sa mémoire, l’autre part chercher. Deux routes pour la même question : normal que les noms ne coïncident pas.

Et pourtant le motif du faux pas se répète. Deux personnes aux trajets domicile-travail totalement différents peuvent être en retard pour la même raison : ni l’une ni l’autre n’est sortie de chez elle.

Si vous n’êtes pas sortie, optimiser deux itinéraires ne change rien.

Jusqu’où ce chiffre voyage

Quatre réserves, et je les dirais toutes avant que ce chiffre n’entre dans une présentation.

  • Deux fournisseurs seulement, OpenAI et Anthropic. Ni Gemini ni Perplexity
  • Marchés américain, britannique et européen, 19 secteurs. Aucune mesure en français
  • Mesure sur une seule journée, sans analyse de la dérive dans le temps
  • Les quatre auteurs travaillent chez Unusual.ai, qui vend de la mesure de visibilité de marque dans l’IA

Ce dernier point pèse sur le sens de la conclusion. « Votre diagnostic est réutilisable » arrange bien une entreprise qui vend du diagnostic.

Cela ne contredit pas pour autant la divergence des résultats dont nous avons déjà parlé. Ce qui diverge, c’est la sortie ; la classification des causes est la partie commune.

diagnostiquer l’étape avant de dédoubler le plan

Ce qu’il faut retenir, c’est l’ordre.

Avant de bâtir un tableau d’actions par fournisseur, insérez une étape. Déterminez si vous perdez à la découverte — le modèle ne vous fait jamais apparaître — ou à la sélection, quand il vous cite puis recommande un concurrent.

Cette réponse tient entre OpenAI et Anthropic avec environ 95 % de fiabilité. Et moins la marque est installée, mieux elle tient.

Dédoubler le plan reste une question légitime. Elle vient simplement après le diagnostic, pas avant.


Sources

  • Will Jack, Noah Lehman, Keller Maloney, Sarah Xu (Unusual.ai), “Divergent Recommendations, Convergent Diagnoses: Cross-Provider Failure-Mode Convergence in AI Commercial Recommendation”, arXiv:2606.26116v1, publié le 22 mai 2026, arxiv.org (215 requêtes commerciales chez OpenAI et Anthropic ; 7 763 échecs conjoints analysés. Similarité de Jaccard entre fournisseurs de 0,35 contre une base de 0,50 à 0,61 pour une relance de la même requête chez le même fournisseur. Le diagnostic du mode d’échec concorde à 95,1 % [94,3 %, 95,7 %], de 81 % pour les leaders de catégorie à 99,6 % pour les marques de longue traîne et régionales. Anthropic a recommandé depuis ses connaissances préalables dans 43 à 52 % des passages, OpenAI dans 8 à 29 %. Marchés américain, britannique et européen, 19 secteurs, mesure sur une seule journée ; les quatre auteurs sont employés par Unusual.ai, fournisseur de mesure de visibilité de marque dans l’IA.)
Partager cet article
Bluesky X
Retour aux articles