Der Bericht führt unsere Seite als Quelle. Der Satz darüber stammt nicht von uns
Ich habe eine KI den eigenen Firmennamen recherchieren lassen und einen sauber gebauten Bericht zurückbekommen, Quellenliste unten dran. Unsere Seite stand da ja mit drin.
Im Text darüber stand dann aber ein Satz über uns, der so auf keiner unserer Seiten steht. Belegt war er ausgerechnet mit unserer eigenen Seite.
An der Stelle habe ich einen Link aufgemacht. Die Seite kam, das Thema passte, den zweiten habe ich dann gar nicht mehr angefasst und einfach weitergelesen. Da hört das Nachschauen halt meistens auf, bei mir wie bei dir.
Über 94 Prozent der Quellenlinks in solchen Berichten gehen überhaupt auf. Ob der Satz, für den sie stehen, auf der verlinkten Seite auch wirklich steht, ist die andere Frage: Bei den Spitzenmodellen trifft das auf 39 bis 77 Prozent der Zitate zu.
Seit ich diese Messung gelesen habe, fehlt in meinem eigenen Sichtbarkeitsbericht eine Spalte.
Wie oft belegen die Quellen, die eine KI anhängt, wirklich die Aussage im Bericht?
Über 94 Prozent der Links gehen auf, über 80 Prozent führen zu einer Seite, die zum Thema passt. Dass die verlinkte Seite die Aussage im Bericht als Tatsache trägt, gilt bei den Spitzenmodellen für 39 bis 77 Prozent der Zitate.
Aufmachen und Stimmen sind eben zwei verschiedene Ereignisse.
Gemessen haben das sechs Leute von PricewaterhouseCoopers, erschienen ist die Arbeit am 7. Mai 2026. 14 KI-Modelle mussten 130 Rechercheaufträge abarbeiten, danach wurde jedes einzelne Zitat in den Berichten wieder aufgemacht und nachgelesen. Die Aufträge stammen aus zwei öffentlichen, englischsprachigen Testsammlungen.
Deep-Research-Agent heißt im Kern: Die KI klappert selbst Dutzende bis Hunderte Seiten ab und schreibt dir daraus einen Bericht mit Quellenliste. Bei ChatGPT und Gemini ist das der Modus, der gründlich recherchieren soll, statt sofort zu antworten.
Die Urteile „passt zum Thema“ und „trägt die Aussage“ hat übrigens keine Person gefällt, sondern eine KI, die nach einem festen Bewertungsraster Punkte vergibt. Geeicht wurde sie an 50 bis 100 von Hand geprüften Fällen. Gelesen hat also niemand alle Zitate.
Dein Sichtbarkeitsbericht zählt die äußerste von drei Schichten
Ein Zitat hängt an einer Aussage im Bericht. Diese Messung schaut sich dasselbe Zitat an drei Stellen an:
- Geht der Link überhaupt auf?
- Passt die verlinkte Seite zum Thema der Aussage?
- Trägt der Inhalt dieser Seite die Aussage als Tatsache?
Die Zahl, die im Sichtbarkeitsbericht als „Zitate“ steht, zählt meistens nur, was die erste Stelle passiert hat. Wer bis zur zweiten schaut, weiß immerhin, dass die KI deine Seite als Beleg behandelt hat.
Die dritte Stelle ist die einzige, die etwas darüber sagt, was die KI über dich erzählt hat. Denn dort geht es um einen anderen Gegenstand: Du kannst die erste Zahl beliebig hoch stapeln, die dritte wird davon nicht sichtbar.
Wer mal eine Hausarbeit geschrieben hat, kennt die Lage. Die Fußnote steht da, das Buch gibt es wirklich, und auf der angegebenen Seite steht halt trotzdem etwas anderes.
Die Quelle existiert also, das Thema passt, und die Zahl im Bericht deckt sich trotzdem nicht mit dem, was auf deiner Seite steht. Welche der drei Stellen hat deine letzte Zitat-Zahl eigentlich passiert?
Auch bei 150 Suchen bleiben Link und Thema über 92 Prozent
Dieselben Autoren haben zwei Modelle unterschiedlich tief suchen lassen, von zwei Suchen bis zu 150.
Die inhaltliche Deckung fiel dabei im Mittel der beiden Modelle um rund 42 Prozentpunkte. GPT-5.4 ging von 79 auf 17 Prozent, Claude Opus 4.6 von 80 auf 58.
Ich hatte angenommen, dass gründlicher suchen auch genauer heißt.
Link und Thema blieben im selben Experiment auf jeder Tiefe über 92 Prozent. Abgerutscht ist allein die dritte Schicht.
Bewegen kannst du an alldem genau eine Sache: ob ein einzelner Satz von dir auch dann noch trägt, wenn ihn jemand allein aus deiner Seite herausgreift. An die Suchtiefe kommst du von dir aus gar nicht dran.
Ob so eine Schreibweise die Deckung hebt, hat diese Arbeit nicht gemessen. Meine Faustregel ist es trotzdem: Drei Dinge gehören in denselben Satz.
- die Zahl selbst — „32 Prozent mehr“
- der Zeitpunkt — „August 2026“
- die Vergleichsbasis — „gegenüber dem Vorjahresmonat“
Heißt, „Im August 2026 lagen unsere Auslieferungen 32 Prozent über dem Vorjahresmonat“ trägt sich auch dann, wenn nur dieser eine Satz herausgegriffen wird. Bei „gegenüber dem Vorjahr deutlich gewachsen“ hängt die Bedeutung an den Absätzen drumherum, und die gehen beim Herausgreifen verloren.
Wo diese Zahlen aufhören, für dein Reporting zu gelten
Gemessen wurden Zitate in Rechercheberichten, die ein Deep-Research-Agent geschrieben hat. Was ChatGPT dir auf eine normale Frage im Chat antwortet, fällt nicht darunter.
Die 130 Aufträge kommen aus englischsprachigen Testsammlungen. Auf Deutsch ist dort nichts gefragt worden, und ob dieselben Zahlen bei deutschen Fragen herauskämen, steht in dieser Arbeit nirgends.
Herausgegeben hat sie PricewaterhouseCoopers, eine Wirtschaftsprüfungs- und Beratungsgesellschaft, die selbst Geld damit verdient, Firmen bei der KI-Einführung zu begleiten. Begutachtet ist da außerdem noch nichts, das Ganze ist eben ein Preprint.
Die 14 Modelle sind bestimmte Versionsstände zum Zeitpunkt der Auswertung. Die Autoren nennen zudem eine Grenze, die alle diese Zahlen mit der Zeit weicher macht: Zitate im Web verschwinden oder ändern ihren Inhalt.
Was bleibt davon für dich übrig?
Die Zahlen selbst wohl nicht. 39 bis 77 Prozent kannst du nirgends als deinen eigenen Wert eintragen. Was bleibt, ist der Rahmen: drei Schichten, getrennt gezählt.
Zehn Zitate im Monat aufmachen und nachlesen, was da über dich steht
Aus den Zitaten, die diesen Monat auf deine Marke zeigen, ziehst du zehn zufällig heraus — nicht die zehn, die dir als Erstes ins Auge fallen, denn dabei sammelst du die schmeichelhaften ein.
Mach sie mal auf, vergleich, was dort über deine Firma steht, mit dem, was auf deiner Seite steht, und notier die Zahl der Treffer.
Was am Ende dasteht, ist weder die Zahl der Links, die aufgingen, noch die Zahl der Themen, die passten. Es ist die dritte Schicht, einmal von Hand gemessen.
Ein Monat mit mehr Zitaten: Ist das, was da über dich steht, im selben Maß richtiger geworden? Genau an dieser Stelle setzt die Messung an. Läuft die Investitionsentscheidung allein über die Spalte mit den Zitat-Zahlen, bleibt der Unterschied bis zum Schluss unsichtbar.
Wer Zitate und Nennungen schon in zwei Spalten führt, hängt hier also eine dritte daneben (Zitate und Nennungen getrennt zählen).
Zehn aufgemachte Zitate sind die erste Zahl, die du über den Inhalt hast.
Quellen
- Onweller, H. et al. (Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S.), “Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents”, arXiv:2605.06635, 7. Mai 2026 (Grenzen: Preprint, noch nicht begutachtet. Gemessen wurden Zitate in Rechercheberichten von Deep-Research-Agenten, nicht gewöhnliche Chat-Antworten. Die 130 Rechercheaufträge stammen aus englischsprachigen Testsammlungen, deutschsprachige Fragen sind nicht darunter. Die Urteile „passt zum Thema“ und „trägt die Aussage“ fällte ein KI-Bewerter, geeicht an 50 bis 100 von Hand geprüften Fällen. Herausgeberin ist PricewaterhouseCoopers, eine Wirtschaftsprüfungs- und Beratungsgesellschaft mit eigenem Geschäft in der KI-Einführung. Die 14 Modelle sind Versionsstände zum Zeitpunkt der Auswertung, und die Autoren nennen selbst die zeitliche Instabilität von Web-Zitaten als Grenze)