Zurück HexScope Lens

2.961 KI-Abfragen später: Das Ranking lügt, die Auftauchrate hält

POINT Kernpunkte
  • Bei 2.961 KI-Abfragen wiederholt sich die exakte Liste in unter 1% der Fälle
  • Die Lösung: die Auftauchrate verfolgen und die Zahl der Wiederholungen festlegen

„Gestern sagte sie A, heute B” – und das Vertrauen bröckelt

Frag eine KI, welche Marken sie empfiehlt, und du bekommst heute die eine Antwort und morgen eine andere. Firma A am Montag, Firma B am Dienstag. Sieh das ein paar Mal, und die ehrliche Reaktion kommt von selbst: Wenn das Ranking nicht stillhält, wie soll ich da überhaupt etwas messen?

Diese Reaktion ist genau richtig. Aber dass ein einzelnes Ranking schwankt und dass die Messung selbst nutzlos ist, sind zwei völlig verschiedene Dinge. Ändere die Einheit, auf die du schaust, und ein Signal taucht auf, das du wirklich behalten kannst.

Heute holen wir dieses „behaltbare” Signal aus einer richtig großen Beobachtung: 2.961 Versuche.

2.961 Abfragen später reproduziert sich der Einzel-Rang so gut wie nie

SparkToro und Gumshoe haben den Test im großen Stil gefahren – 600 Leute, 2.961 Abfragen insgesamt – nur um zu messen, wie stark die Empfehlungen schwanken. Das Ergebnis ist unmissverständlich.

  • Dieselbe Liste tauchte in unter 1 % der Fälle wieder auf.
  • Die exakte Reihenfolge stimmte in rund 0,1 % der Fälle überein.

Ein Antwort-Screen als „das Ranking dieses Monats” zu melden, ist also heikel. Das ist, als würfle man einmal und beschließe, dieser Würfel bevorzuge die Eins. Auf dieser Basis ist das Ranking vor allem Rauschen.

Doch die Auftauchrate blieb stabil und vergleichbar

Das hier darfst du aber nicht übersehen. In denselben Daten hielt die Auftauchrate. Eine gut sichtbare Marke tauchte zum Beispiel in 97 % von 71 Versuchen auf – sobald du also fragst „wie oft kommt sie vor” statt „auf welchem Platz steht sie”, ist die Reproduzierbarkeit da.

Noch spannender: Selbst Prompts, die sich inhaltlich nicht ähnelten, lieferten tendenziell überlappende Mengen an Marken. Das passt sauber zu Errica et al. (NAACL 2025), die zeigen, dass die Bedeutungsstruktur stärker wirkt als die Formulierung an der Oberfläche. Ändere das Wie der Formulierung, und die Antwort hält; ändere das Was der Bedeutung, und sie verschiebt sich.

Der eigentliche Wettkampf ist das Messdesign, nicht der Modellvergleich

Die typische Falle in der Praxis: mit „welches Modell ist schlauer” einsteigen und die Messbedingungen überspringen. Ob du denselben Prompt 60- bis 100-mal laufen lässt oder nach weniger als 10 Versuchen abbrichst, ändert komplett, wie viel du aus den Zahlen herauslesen kannst.

Noch ein wichtiger Punkt: nicht nur den Mittelwert melden, sondern auch das drumherum. Zwei Marken können unterschiedlich wirken, während sich ihre Fehlerbänder schlicht überlappen – dieser Fall ist häufiger, als man denkt.

Fazit: Bedingungen angleichen, nicht dem Rang hinterherjagen

Wenn du KI-Empfehlungen Monat für Monat verfolgst, bringt dir das Angleichen der Messbedingungen mehr als das Zittern bei jedem Rang-Ausschlag. Was 2.961 wiederholte Messungen wirklich lehren: Weil die Antworten der KI von Natur aus verrauscht sind, solltest du die Auftauchrate lesen, nicht den Einzel-Rang.

Wenn du also ein Tool auswählst, prüf, ob es seine Wiederholungszahl und die Logik hinter der Auftauchraten-Aggregation offenlegt. Dasselbe gilt für deine internen Reports – gleiche Fragegestaltung, Modellbedingungen und Aggregationszeitraum an. Kippt das, kannst du eine echte Verbesserung nicht mehr von einer geänderten Messweise unterscheiden.

Wenn du den Gesamtblick über sieben verwandte Studien willst, ist diese Übersicht zu „Auftauchrate statt Rang” ein guter Einstieg ins Ganze.


Quellen

  • Rand Fishkin (SparkToro/Gumshoe), „NEW Research: AIs are highly inconsistent when recommending brands or products; marketers should take care when tracking AI visibility”, 2026-01-27, sparktoro.com
  • Federico Errica, Giuseppe Siracusano, Davide Sanvito, Roberto Bifulco, „What Did I Do Wrong? Quantifying LLMs’ Sensitivity and Consistency to Prompt Engineering”, NAACL 2025, arXiv:2406.12334
Diesen Artikel teilen
Bluesky X
Zurück zur Übersicht