„Wir sind in unserer Branche bekannt, da sollte die KI uns doch richtig hinkriegen”
Du fragst die KI nach deiner Marke, und sie antwortet. Die Erwähnungsquote in deinem Sichtbarkeitsreport liegt auch über dem Branchendurchschnitt.
Erwähnungsquote ist der Anteil der KI-Antworten, die deine Marke überhaupt nennen.
Im Reporting-Meeting zeigst du dann meist auf genau diesen Balken und gehst zum nächsten Punkt über.
Erst zu prüfen, ob du überhaupt erwähnt wirst, ist die richtige Reihenfolge — steht dein Name nicht in der Antwort, gibt’s sonst nichts zu prüfen.
Zwingst du die KI aber dazu, ihrer Antwort eine Quellen-URL beizulegen, und öffnest diese URL dann wirklich, ist die Seite manchmal nicht da. Und das passiert offenbar häufiger, nicht seltener, bei bekannten Firmen.
Ich hab die Studie gelesen, die das Zitat für Zitat durchgezählt hat, und das hat verändert, wie ich unsere eigenen Reports lese.
Was solltest du bei einer bekannten Marke eigentlich messen?
Ob die URLs, die die KI zitiert, wirklich aufgehen — zusätzlich zur Erwähnungsquote.
Bei Fragen, die eine URL oder einen Dokumentenverweis verlangten, gingen 52,69% der Zitate zu 50 bekannten ungarischen Firmen ins Leere. Das sind börsennotierte Unternehmen und lokale Töchter globaler Marken, alle international in den Medien präsent. Bei 50 kleineren ungarischen Firmen mit geringer internationaler Sichtbarkeit lag der Wert bei 37,87%. Differenz: 14,82 Punkte — genau in die andere Richtung, als man erwarten würde.
Das Gegenteil der Annahme vom Anfang.
Zoltán Varga von Neural Awareness in Budapest hat die Zitate, die die KI zu 100 B2B-Firmen lieferte, einzeln nachgeprüft (R).
Es ist ein Preprint, veröffentlicht am 19.06.2026, noch nicht begutachtet. Das Titelblatt nennt nur diese eine Zugehörigkeit, und nur einen Autor.
Die 100 Firmen wurden nach Bekanntheitsgrad in zwei Gruppen geteilt.
- Bekannte Gruppe: 50 Firmen — börsennotierte Unternehmen und lokale Töchter globaler Marken, alle mit internationaler Medienpräsenz
- Weniger bekannte Gruppe: 50 ungarische Firmen mit wenig internationaler Präsenz und wenig englischsprachiger Berichterstattung
Sieben Fragetypen, alle auf Ungarisch, zu Themen wie -Richtlinien, ISO-Zertifizierung, regulatorische Verfahren oder Handelsregistereinträge — jede Frage verlangte eine URL oder einen Dokumentenverweis in der Antwort.
Geantwortet haben zwei Modelle: Claude Sonnet 4.6 und GPT-4o, beide ohne Live-Suche — beide antworten aus dem, was sie im Training gelernt haben, nicht aus einer frischen Recherche.
Jede Firma bekam dieselben 7 Fragen bei beiden Modellen je einmal gestellt, bei 100 Firmen macht das 1.400 Prompts insgesamt. Dabei kamen 2.062 Zitate zusammen, jedes einzeln per Skript geprüft, nicht von einer anderen KI bewertet. Als „geht nicht auf” zählte eine URL ohne normale Antwortseite und eine DOI (die Registrierungsnummer von Artikeln und Dokumenten), die im Register nicht zu finden war.
Weniger bekannte Firmen bekamen von vornherein weniger Zitate
Wie oft kam überhaupt eine Quelle? Bei den Fragen, die eine URL verlangten, nannte Claude bei den bekannten Firmen in 85,7% der Antworten mindestens eine, bei den weniger bekannten in 74,3%. GPT-4o kam bei den bekannten Firmen nur auf 30,0%, bei den weniger bekannten sogar nur auf 14,3% — GPT-4o hat bei den kleineren Firmen also oft schlicht gar keine Quelle genannt.
Vargas eigene Lesart: Bei einer unbekannten Firma zieht sich das Modell eher zurück, statt zu zitieren. Deshalb kippen die Fehler bei der weniger bekannten Gruppe Richtung „kein Zitat” statt Richtung „kaputtes Zitat”.
Warum gab es bei der bekannten Gruppe dann mehr kaputte Zitate statt weniger?
Varga nennt dieses Muster „das Paradox der Marken-Halluzination”. Laut ihm kennt das Modell eine bekannte Firma gut genug, um eine URL zu konstruieren, die plausibel aussieht — aber nicht gut genug, um sie an eine wirklich existierende Seite zu binden.
Das ist aber eine Lesart, kein kontrolliertes Experiment: Es ist eine Beobachtung über zwei Gruppen hinweg, kein Test, bei dem die Bekanntheit erhöht und die Quote kaputter Zitate dabei verfolgt wurde. Die Gruppen unterscheiden sich auch in der Firmengröße, und die Studie trennt nicht, wie viel der Differenz auf Bekanntheit und wie viel auf Größe zurückgeht.
Regulatorische Fragen dazuzunehmen bringt den Fehler ans Licht, den du wirklich sehen willst
Anteil kaputter Zitate nach Fragetyp: Fragen zu regulatorischen Verfahren oder Bußgeldern der letzten drei Jahre lagen am höchsten, mit 56,77%, dicht gefolgt von DSGVO-Richtlinienfragen mit 53,05%.
Die Kontrollfrage zum Handelsregistereintrag lag bei 37,59%; die ISO-Zertifizierungsfrage (35,33%) hob sich davon nicht klar ab.
Von den 946 nicht aufgehenden Zitaten kam bei 478 schlicht „Seite nicht gefunden” zurück. Die Domain existierte ja; es fehlte nur die konkrete Seite.
Das ist, als würdest du den richtigen Bahnhof genannt bekommen, aber die falsche Ausgangsnummer.
Von diesen 478 zeigten 51,9% nicht auf die eigene Website der Firma, sondern auf die ungarische Wettbewerbsbehörde, die Datenschutzbehörde, die Zentralbank oder Gerichte.
Wie viele deiner eigenen Prompt-Sets fragen nach regulatorischer Historie oder DSGVO-Konformität? Ist die Antwort null, misst du genau ohne die Fragetypen, die diese Studie als am wenigsten zuverlässig gefunden hat.
Diese Zahl ist ungarisch, und die Fragen waren darauf ausgelegt, eine URL zu erzwingen
Bei jeder Antwort eine URL zu verlangen, ist eine Design-Entscheidung, die absichtlich Richtung Erfindung drängt — alle sieben Fragetypen teilen diese Form. Heißt das, ohne diesen Zwang wäre die Hälfte der alltäglichen Zitate auch erfunden?
So weit trägt die Studie nicht. Die 52,69% kommen mit mehreren Bedingungen.
- Beide getesteten Modelle suchen nicht live; gemessen wurde zu einem einzigen Zeitpunkt, dem 22.05.2026
- Perplexity, das live sucht, liegt außerhalb des Haupttests; ein Seitenvergleich mit 2 Firmen ergab 7,32% kaputte Zitate von 123, gegenüber 32–44% bei den nicht suchenden Modellen
- 1.881 der 2.062 Zitate kamen von Claude; die Studie gibt die Zahlen von GPT-4o nicht getrennt nach Gruppe an, diese Seite des Splits lässt sich also mit den vorliegenden Daten nicht nachvollziehen
- Der Wert ist eine Obergrenze: Er zählt alles, was nicht überprüft werden konnte, und rund 16,4% der als „kaputt” markierten Zitate waren aus Gründen wie blockiertem Zugriff nicht erreichbar — nicht bestätigt als tatsächlich nicht existent
- Die Firmen sind ungarische B2B-Unternehmen, die Fragen sind auf Ungarisch, und diese Studie enthält keine japanischsprachige Messung
- Es ist ein Preprint, und die Studie zählt mehrere Zitate derselben Firma zur selben Frage als eigenständige Datenpunkte — was der Autor selbst als möglichen Grund nennt, warum der statistische Test dafür, dass diese Differenz kein Zufall ist, etwas großzügiger ausfällt, als er sollte
Die 52,69% in deine eigene Prognose zu übernehmen, verlangt der Zahl mehr ab, als ihre Bedingungen hergeben. Was diese Messung wirklich stützt, ist enger gefasst: Die beiden Gruppen sind auf unterschiedliche Weise gescheitert, und dieser Unterschied lohnt eine Prüfung.
erst klären, in welcher Gruppe du stehst, dann einen Fehler auswählen
Der Split lief über eine einzige Linie: börsennotierte Unternehmen und lokale Töchter globaler Marken mit internationaler Medienpräsenz auf der einen Seite, ungarische Firmen mit wenig internationaler Präsenz auf der anderen. Firmen dazwischen waren nicht Teil des Vergleichs.
Steht deine Marke klar auf der bekannten Seite, würde ich die Quellenprüfung zu dem hinzunehmen, was du ohnehin an Erwähnungsquote misst: die Zitate, die die KI deinem Namen beilegt, wirklich öffnen — mit regulatorischen und DSGVO-Fragen in der Mischung. Das waren hier die Fragetypen mit den meisten kaputten Zitaten.
Steht deine Marke klar auf der weniger bekannten Seite, dreh die Reihenfolge um: prüf erst, ob Name und Zitat überhaupt auftauchen, bevor du dich sorgst, ob das Zitat aufgeht.
Wie genau ein Zitat ist, sobald es aufgeht, ist die nächste Ebene — ChatGPT zitiert deine Marke. Hast du mal gelesen, was da eigentlich steht? geht da weiter. Den verfolgten Fehler zu wechseln, bringt manchmal eine Lücke ans Licht, die die Erwähnungsquote nie gezeigt hat.
Quellen
- Varga, Z., „Per-Entity Bias Mapping for AI Visibility: Why Brand Mentions Require Entity-Specific Calibration”, arXiv:2606.21595, 19.06.2026, https://arxiv.org/abs/2606.21595