Retour HexScope Lens

Une ligne sur la personne qui pose la question, et l'IA change de marques

POINT Points clés
  • Nommer l'acheteur remplace jusqu'à 75 % des marques du milieu
  • 2 000 exécutions : 10 profils, 8 questions, 3 configurations de modèle

« Ce chiffre-là, il vient de qui, au juste ? »

Vous avez sorti le chiffre vous-même, et pourtant vous n’arrivez pas à le défendre dès que quelqu’un insiste un peu.

Sur quelle part des questions votre nom sort : ça, on peut le montrer. Ce qui a bougé depuis le mois dernier : ça aussi. Deux vrais chiffres.

Demandez qui posait la question, et le sol se ramollit.

Chez Hex-ko, l’hypothèse a tenu des années : même texte, donc mêmes conditions. Mêmes mots en entrée, même terrain de jeu.

Puis quelqu’un a collé devant une seule ligne sur la personne qui interroge, et d’autres marques sont revenues. 2 000 fois de suite : allons voir ce qui a bougé.

L’IA recommande-t-elle des marques différentes selon qui l’interroge ?

Oui. À question rigoureusement identique, si on met devant « vous êtes le patron d’une petite entreprise britannique », le recouvrement entre les deux listes de marques baisse de 0,12 à 0,20.

Ce qui a bougé, c’est le milieu de tableau. Les marques de milieu de marché ont vu jusqu’à 75 % de leurs noms remplacés d’un profil à l’autre, quand les leaders de catégorie gardaient environ 80 % de leurs places, quel que soit l’interlocuteur.

Le travail est une prépublication — un article mis en ligne avant toute relecture par les pairs — de Will Jack, Noah Lehman, Keller Maloney et Sarah Xu, de l’équipe Unusual.ai, déposée sur arXiv le 28 mai 2026 (l’étude).

La mesure porte sur des chats commerciaux qui répondent en s’appuyant sur des résultats de recherche en direct. Dix profils × huit questions × trois configurations de modèle × dix répétitions, soit 2 000 exécutions.

Un profil (persona), ici, c’est une ligne de mise en situation : celui qui pose la question est ce genre de personne. Ils en ont fabriqué dix à la main, en croisant secteur, taille d’entreprise, fonction et pays — un fondateur solo aux États-Unis, une responsable des achats en grand groupe, un patron de PME britannique, et sept autres du même tonneau.

La première place ne bouge pas. Au milieu, des chaises se libèrent.

C’est la notoriété de la marque qui décide du poids du profil. L’étude classe les marques par niveau de notoriété, puis donne pour chaque niveau la part de la liste qui se renouvelle quand le profil change.

Sur les trois configurations de modèle, les fourchettes donnent ceci :

  • Leaders de catégorie : 20-29 %
  • Milieu de marché : 39-75 %
  • Acteurs régionaux : 27-33 %

Le leader sort pour tout le monde, sa chaise est donc vissée au sol. Au milieu, les chaises se vident et se remplissent à chaque changement d’interlocuteur.

Ça ressemble à une mauvaise nouvelle, et ça se lit plutôt dans l’autre sens : une chaise que personne n’a vissée, c’est une chaise où l’on peut s’asseoir.

Et si on repose deux fois la même question, on récupère quoi ?

La mesure de recouvrement utilisée ici s’appelle l’indice de Jaccard : elle note de 0 à 1 ce que deux listes ont en commun. Autrement dit, plus on est près de 1, plus ce sont les mêmes marques qui s’alignent.

D’un profil à l’autre, ce recouvrement se situe entre 0,22 et 0,35. Et à profil constant, en répétant simplement la même question, il ne monte qu’à 0,42-0,51.

Donc la même personne, posant la même question, récupère à chaque fois une liste presque à moitié différente. L’effet du profil vient se poser par-dessus.

Que reste-t-il alors d’un « ce mois-ci on était dans les recommandations » mesuré une seule fois ? À peu près autant qu’un portrait psychologique tiré d’une partie de pierre-feuille-ciseaux. Si votre marque n’est pas la première du secteur, ces entrées et sorties d’un mois sur l’autre pourraient relever de la structure du phénomène plutôt que du bruit de votre mesure.

L’ordre compte, je trouve : répéter d’abord, séparer par profils ensuite, parce que s’il manque l’un des deux, l’écart ne se lit pas.

Jusqu’où peut-on emmener ça chez soi ?

Les quatre auteurs travaillent tous chez Unusual.ai, un éditeur d’outils de visibilité de marque dans les IA, et la conclusion « il faut mesurer par profil » l’arrange plutôt bien. Cinq autres choses bornent la portée de ces chiffres.

  • L’état de la relecture par les pairs n’est indiqué nulle part : c’est une prépublication
  • Dix profils faits à la main, en anglais uniquement, concentrés sur les États-Unis, le Royaume-Uni et l’UE
  • Mesure sur une seule journée, donc la variation d’un jour à l’autre reste non évaluée
  • Le niveau des spécialistes de longue traîne manquait d’effectif dans toutes les conditions (moins de 30 cas par cellule) et ne reçoit aucun chiffre
  • La configuration Anthropic ne couvre que 4 des 8 questions

Et de causalité, aucune. Ce qu’on peut dire s’arrête à « changer l’interlocuteur a changé le résultat ». Le « écrivez un profil et vous décrochez la recommandation », l’étude ne le dit jamais.

Les deux fournisseurs ne se sont pas comportés pareil non plus. Le modèle d’Anthropic réagissait davantage au profil (la baisse de 0,20), et 43 à 52 % de ses recommandations n’étaient rattachées à aucun résultat de recherche. Sur les configurations OpenAI, cette proportion tombe à 8-29 %.

Les auteurs y voient une différence dans la part de la réponse qui s’appuie sur les connaissances d’entraînement plutôt que sur la recherche, et ils écrivent honnêtement que le mécanisme reste incertain. Pour moi, c’est surtout une raison de mesurer chaque IA pour elle-même. Cela dit, une seule journée de mesure, c’est peu, et je m’appuie peut-être dessus plus qu’elle ne peut porter.

posez la même question en vous mettant à la place de deux ou trois clients

Rangée sur une seule courbe, la visibilité IA écrase toute cette agitation entre profils dans une moyenne. Et pour une marque de milieu de marché, cette moyenne est assise sur un sacré remue-ménage de chaises.

Ce qui change en premier, c’est seulement la façon d’envoyer la question. Notez deux ou trois de vos types de clients principaux, envoyez votre question habituelle précédée de chacun d’eux, et posez les résultats côte à côte.

Parce qu’en moyennant, le niveau où les chaises sont libres s’annule contre celui où elles sont prises. Séparés, on voit enfin dans la réponse de quel client votre nom manque.

Ce chiffre, il vient de qui ? C’est l’étiquette que Hex-ko aimerait lire sur la courbe avant de lire la courbe.


Sources

  • Will Jack, Noah Lehman, Keller Maloney, Sarah Xu (Unusual.ai), « Persona Conditioning of Brand Recommendations in Retrieval-Augmented Commercial Chat: A Prominence-Stratified Cross-Provider Audit », prépublication arXiv 2605.30207v1, 28 mai 2026, arxiv.org (plan factoriel de 10 profils × 8 questions × 3 configurations de modèle × 10 répétitions, soit 2 000 exécutions. Les configurations sont GPT-5.4-mini en effort de raisonnement faible et élevé, plus Claude-sonnet-4.6 en effort faible. Le profil placé en tête fait baisser la similarité de Jaccard de l’ensemble recommandé de −0,12 [intervalle à 95 % −0,153, −0,091], −0,16 [−0,194, −0,139] et −0,20 [−0,263, −0,156], et aucun des trois intervalles ne contient zéro. D’un profil à l’autre, la similarité va de 0,22 à 0,35 ; à l’intérieur d’un même profil, de 0,42 à 0,51. Taux de renouvellement des recommandations par niveau de notoriété : leaders de catégorie 23 %/29 %/20 %, challengers établis 5 %/13 %/23 %, milieu de marché 75 %/67 %/39 %, acteurs régionaux 27 %/33 %/—. Dans les termes du résumé lui-même, les leaders de catégorie gardent environ 80 % de constance, tandis que le milieu de marché voit jusqu’à 75 % de son casting changer. Les recommandations sans lien avec une source récupérée représentent 43 % à 52 % chez Anthropic et 8 % à 29 % chez OpenAI. Limites : les quatre auteurs travaillent chez Unusual.ai, un éditeur d’outils de visibilité de marque dans les IA qui a un intérêt commercial dans cette conclusion ; l’état de la relecture par les pairs n’est pas précisé ; le niveau de longue traîne manque d’effectifs dans toutes les cellules, avec moins de 30 apparitions de marque par cellule ; les cellules sonnet ne couvrent que 4 des 8 questions ; les profils sont 10 rédigés à la main, uniquement en anglais et concentrés sur les États-Unis, le Royaume-Uni et l’UE ; les variantes de formulation du préambule n’ont pas été testées ; la mesure porte sur une seule journée, la dérive dans le temps n’est donc pas évaluée ; et l’explication avancée par les auteurs — le profil agirait sur la génération à partir des connaissances acquises, pas sur la récupération — reste non confirmée)
Partager cet article
Bluesky X
Retour aux articles