„Von diesen dreißig — womit fangen wir denn jetzt an?”
Strukturierte Daten rein. Zitate dazu. Statistiken dazu. Ich habe Maßnahmen für die KI-Suche aufgeschrieben, bis die Tabelle auf dreißig Zeilen stand.
Im Jour fixe letzten Monat hing genau diese Tabelle zwanzig Minuten an der Wand. Niemand hat auf Zeile eins gezeigt, und dann ging es halt weiter mit dem nächsten Tagesordnungspunkt.
Ein Papier, das 45 Studien zur Optimierung für KI noch einmal durchgelesen hat, findet zwei Faktoren, die über alle untersuchten Plattformen hinweg gehalten haben. Und sonst keinen.
Das ist ein Preprint. Begutachtet hat das von außen noch niemand.
Welche KI-Maßnahmen halten über die Studienlage hinweg?
Zwei: wie relevant ein Dokument für die gestellte Frage ist und an welcher Stelle es im Kontext steht, mit dem das Modell arbeitet. Nur die beiden stehen noch, nachdem die 45 Studien nebeneinandergelegt wurden und die Bedingungen darunter gewechselt haben (die von Martinez).
GEO heißt im Kern: Suchmaschinen-Optimierung, aber für die KI-Antwort statt für die Trefferliste. Für dich heißt das, du arbeitest darauf hin, dass deine Seiten in der Antwort zitiert oder erwähnt werden.
Die 45 Papiere sind zwischen dem 16. November 2023 und dem 14. Juli 2026 erschienen.
Und wo fasst man die zwei denn an, wenn man vor einer echten Seite sitzt?
Auf die Frage antworten schlägt autoritativ klingen
Der erste Faktor ist die Übereinstimmung zwischen Frage und Dokument. Modelle greifen zur ausdrücklichen Übereinstimmung mit der Anfrage, bevor sie zu dem greifen, was ein Mensch als Zeichen von Seriosität liest — so fasst die Survey die 45 Studien zusammen.
Die Zahlen darunter sind allerdings nicht ihre eigenen. Sie stehen in dem Papier von 2024, das das Wort GEO geprägt hat (Aggarwal und Kollegen). Das Team hat 10.000 Fragen aus neun Datensätzen über 25 Themenfelder zusammengetragen.
Und was kam raus? Gemessen wurde, was jede Art, eine Seite umzuschreiben, mit ihrer Sichtbarkeit in der Antwort macht:
- Wörtliche Zitate ergänzen: rund 44 Prozent.
- Statistiken und konkrete Zahlen ergänzen: rund 34 Prozent.
- Quellen benennen: rund 29 Prozent.
Alle drei sind relative Verbesserungen gegenüber einem Ausgangswert, gemessen mit einer Kennzahl, die zählt, wie viel von der Antwort dein Inhalt einnimmt, und das nach der Stelle gewichtet, an der er auftaucht.
Autoritativer schreiben landete bei rund 13 Prozent, Keywords stapeln bei rund 8 Prozent im Minus — beides mit derselben Kennzahl gegen denselben Ausgangswert gemessen.
Stell die fünf mal nebeneinander.
Oben stehen die Maßnahmen, die die Antwort inhaltlich konkreter machen. Unten die, die bloß am Ton drehen.
Aus dieser Reihenfolge liest die Survey, dass das Modell die Übereinstimmung vor dem Autoritätssignal nimmt.
Diese Lesart stammt vom Autor der Survey. Denn ein eigenes Experiment neben den 45 gibt es nicht.
Anfassen kannst du davon die Überschrift und den Absatz darunter. Nimm doch die Frage, die dein Leser wirklich eintippt, setz sie als Aussagesatz in die Überschrift und beantworte sie zu Ende, bevor die nächste Überschrift kommt.
Die Quelle nach oben schieben wiegt schwerer als Umschreiben
Der zweite Faktor ist die Position im Kontext. Eine Quelle in diesem Kontext weiter nach oben zu schieben wiegt schwerer als die meisten Umschreibungen.
Der ist der Stapel Dokumente, den das Modell kurz vor dem Schreiben zusammenholt. Was außerhalb dieses Stapels liegt, bleibt auch außerhalb der Antwort — da hilft die schönste Formulierung nichts.
Heißt, die Position meint hier die Reihenfolge im schon zusammengeholten Stapel. Wer dabei oben landet, entscheidet eben der Abrufschritt, und da kommst du von außen nicht ran.
Bleibt auf deiner Seite denn überhaupt etwas übrig?
In einem dieser Dokumente ist es sehr wohl deine Sache, wo die Antwort steht. Eine Seite, die auf dem ersten Bildschirm antwortet, und eine, die erst fünf Bildschirme weiter unten antwortet, geben nicht denselben Ausschnitt her.
Nur misst die Survey halt die Reihenfolge von Dokumenten untereinander, nicht die Reihenfolge innerhalb einer Seite. Ich schiebe da also eine Vermutung dazwischen, und womöglich springe ich damit über eine Lücke, die sich nicht überspringen lässt.
Erst abgerufen werden, dann über die Platzierung reden
Allgemeine Kniffe wandern eben nicht von einer Plattform zur nächsten. Für eine Umschreibung, die bei einem Assistenten gewirkt hat, gibt es beim nächsten keinerlei Bestätigung.
Die Survey sagt es noch härter. Von den 45 Studien hat keine einzige einen ursächlichen Effekt auf die natürliche Auffindbarkeit gezeigt, der zugleich über Plattformen hinweg und über die Zeit stabil geblieben wäre.
Viele der berichteten Zuwächse wurden ja an Dokumenten gemessen, die schon im Kandidatenstapel lagen. Über das, was eine Seite in den Stapel bringt, sagen diese Zahlen damit nichts.
Was kommt also zuerst?
Zuerst kommt, überhaupt abgerufen zu werden — von der Suche gefunden, in der Kandidatenliste gelandet — zusammen mit der Relevanz für die Frage. Wie du danach platziert bist, ist die zweite Arbeit, und die zahlt sich erst aus, wenn die erste erledigt ist.
Du kannst den Aufsteller am Regal so oft neu malen, wie du magst — steht die Ware nicht im Regal, fällt kein Blick darauf.
Was in diesen 45 Studien eigentlich gemessen wurde
Der Autor sortiert die Belege in fünf Stufen. Oben stehen Feldversuche, die die Bedingungen zufällig zuteilen, unten synthetische Szenarien mit festem Kontext. Eine misst, wie weit ein Befund trägt — und zwar an der Anlage der Studie, nicht an dem, was sie gefunden hat.
Ein guter Teil der 45 landet halt auf dieser unteren Stufe, den synthetischen Szenarien mit festem Kontext. Gemessen wurde also unter Bedingungen, in denen der Moment fehlt, in dem eine echte Suche losgeht und Dokumente heranholt.
Zudem ist das hier gar keine neue Messung. Es ist eine Neulektüre von 45 Papieren, die es schon gab (arXiv:2607.14035, erschienen am 15. Juli 2026).
Auf der ersten Seite steht auch nicht, wo der Autor arbeitet. Da stehen eine Kontaktadresse und eine ORCID — die Kennnummer, die jede forschende Person zugeteilt bekommt — und sonst nichts. Diese Arbeit danach zu gewichten, wer sie unterschrieben hat, fällt damit aus.
Die erfassten Studien kommen außerdem überwiegend aus dem englischen Sprachraum. Ob dieselben zwei Faktoren auch in deutschsprachigen Antworten halten, hat bisher schlicht niemand gemessen. Womit das Nachzählen bei dir liegt.
Teil die Liste in Relevanz, Position und den Rest
Mal dir drei Kästen neben die Maßnahmentabelle. Zeilen, die auf die Relevanz zur Frage einzahlen. Zeilen, die auf die Stelle einzahlen, an der du nach dem Abruf stehst. Und Zeilen, die weder noch sind.
Der dritte Kasten wandert nicht in den Papierkorb. Keine der 45 Studien hat gezeigt, dass diese Zeilen nichts bringen — gefehlt hat ein gleichbleibender Effekt, und ich schiebe eine Zeile lieber nach hinten, als der Forschung ein Ergebnis anzudichten, das sie nie geliefert hat.
Die Relevanz kommt zuerst.
Der Kasten mit der Position geht auf, wenn die Abrufseite steht.
Wie stark einzelne Maßnahmen die Zitate bewegen, steht in Damit die KI dich zitiert: Zahlen und Quellen schlagen jeden SEO-Trick. Warum Platzierung in der Suche und Zitat in der KI zwei verschiedene Dinge sind, steht in ‚Bei Google verlieren wir, bei der KI erst recht’ — von wegen, gerade Platz 11 zählt.
Aus meinen dreißig sind neun und einundzwanzig geworden.
Zwanzig Minuten Schweigen im Jour fixe — und auf neun Zeilen zusammengestrichen lässt sich dieselbe Tabelle auf einmal zeigen.
Quellen
- Martinez, O., „Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026)”, arXiv:2607.14035, 2026-07-15, https://arxiv.org/abs/2607.14035
- Aggarwal, P. et al., „GEO: Generative Engine Optimization”, 2024, https://arxiv.org/abs/2311.09735