« Hier c’était A, aujourd’hui c’est B » — et la confiance s’effrite
Demandez à une IA quelles marques elle recommande, et vous obtenez une réponse aujourd’hui, une autre demain. Marque A lundi, marque B mardi. Voyez ça se répéter quelques fois, et la réaction honnête tombe toute seule : si le classement ne tient pas en place, comment voulez-vous mesurer quoi que ce soit ?
Cette réaction est parfaitement fondée. Mais qu’un classement isolé fluctue et que la mesure elle-même soit inutile, ce sont deux choses très différentes. Changez l’unité que vous regardez, et un signal exploitable apparaît.
Alors aujourd’hui, allons chercher ce signal « exploitable » dans une observation vraiment massive : 2 961 essais.
2 961 requêtes plus tard, le rang isolé ne se reproduit quasiment jamais
SparkToro et Gumshoe ont fait tourner l’expérience à grande échelle — 600 personnes, 2 961 requêtes au total — juste pour mesurer l’ampleur des variations. Le résultat est sans détour.
– La liste exacte se reproduisait dans moins de 1% des cas. – L’ordre exact coïncidait dans environ 0,1% seulement.
Reporter un écran de réponse comme « le classement du mois », c’est donc jouer avec le feu. C’est lancer un dé une fois et décréter que ce dé favorise le 1. Sur cette base, le classement est surtout du bruit.
Mais le taux d’apparition, lui, restait stable et comparable
Voilà ce qu’on ne peut pas rater, pourtant. Dans les mêmes données, le taux d’apparition tenait bon. Une marque très visible ressortait dans 97% des 71 mesures, par exemple — donc dès qu’on demande « à quelle fréquence sort-elle » plutôt que « à quelle place elle est », la reproductibilité est là.
Plus amusant encore : même des prompts qui n’étaient pas proches par le sens tendaient à renvoyer des ensembles de marques qui se rejoignaient. Ça colle parfaitement avec Errica et al. (NAACL 2025), qui montrent que la structure du sens pèse plus que la formulation de surface. Changez la tournure, la réponse tient ; changez le sens, elle bouge.
Le vrai enjeu, c’est le protocole de mesure, pas la comparaison de modèles
Le piège classique, en pratique, c’est d’attaquer par « quel modèle est le plus fort » en survolant les conditions de mesure. Faire tourner le même prompt 60 à 100 fois ou trancher après moins de 10 essais, ça ne donne pas du tout la même précision de lecture.
Autre point clé ici : reporter non seulement la moyenne, mais aussi l’ autour d’elle. Deux marques peuvent sembler différentes alors que leurs marges d’erreur se chevauchent tout simplement — le cas est plus fréquent qu’on ne le croit.
Conclusion : alignez les conditions, ne courez pas après le rang
Pour suivre les recommandations IA d’un mois sur l’autre, aligner ses conditions de mesure vaut bien mieux que de trembler à chaque variation de rang. Ce que 2 961 mesures répétées nous apprennent, c’est ceci : puisque les réponses de l’IA sont bruitées par nature, il faut lire le taux d’apparition, pas le rang isolé.
Alors quand vous choisissez un outil, vérifiez s’il publie son nombre de répétitions et la logique d’agrégation du taux d’apparition. Idem pour vos rapports internes : alignez la conception des questions, les conditions de modèle et la période d’agrégation. Si ça dérape, impossible de distinguer une vraie amélioration d’un simple changement de méthode.
Pour prendre du recul sur sept études connexes d’un coup, ce panorama sur « le taux d’apparition plutôt que le rang » fait une bonne porte d’entrée.
Sources
- Rand Fishkin (SparkToro/Gumshoe), « NEW Research: AIs are highly inconsistent when recommending brands or products; marketers should take care when tracking AI visibility », 2026-01-27, sparktoro.com
- Federico Errica, Giuseppe Siracusano, Davide Sanvito, Roberto Bifulco, « What Did I Do Wrong? Quantifying LLMs’ Sensitivity and Consistency to Prompt Engineering », NAACL 2025, arXiv:2406.12334