Logo von rethink.expert
11.10.2026 · AI Search & Visibility

Erfundener Begriff, echte Zitate: Warum eine zitierte Quelle noch nicht die Antwort prägt

Michael MohauptVon Michael Mohaupt
GEOMeasurementContent Provenance

Ein Forschungsteam hat einen Begriff erfunden, im Netz Beiträge darüber gestreut und beobachtet, was KI-Suchen daraus machen. Die meisten Systeme verlinkten die Beiträge binnen Tagen als Quelle. Ob auch die darin enthaltenen Aussagen im Antworttext standen, hing stark vom System und vom Thema ab. Für die Messung von KI-Sichtbarkeit ist dieser Unterschied wichtiger als die Schlagzeile.

8 von 10KI-Suchen verlinkten binnen sieben Tagen Beiträge zum erfundenen Begriff
0 %der Perplexity-Antworten gaben die Testinhalte wieder, obwohl sie in 37 % als Quelle verlinkt waren

Quelle: Liu et al., „From Public Posts to AI-Search Citations“, arXiv-Preprint, Oktober 2026.

Auf einen Blick
  • →Forschende veröffentlichten Beiträge über einen erfundenen Begriff mit eindeutigen Markierungen. Acht von zehn KI-Suchen verlinkten diese Beiträge innerhalb von sieben Tagen als Quelle, darunter ChatGPT, Perplexity und Google AI.
  • →Quellenlink und Wiedergabe im Antworttext liefen je nach System weit auseinander: Perplexity verlinkte die Testbeiträge in 37 % der Antworten, die Markierungen standen in keiner. Bei Grok lagen beide Werte deutlich näher beieinander.
  • →Der Ort zählte mehr als die Menge: Ein Beitrag auf einer bevorzugt verlinkten Plattform wirkte stärker als über 20 vergleichbare Beiträge anderswo.
  • →Für GEO-Monitoring heißt das: Quellenlinks zählen reicht nicht. Entscheidend ist, welche Aussage in der Antwort steht und woher sie stammt. Und: Teils blieben Links und Inhalte auch nach dem Löschen der Beiträge in den Antworten.
Das Experiment

Ein erfundener Begriff mit eingebauten Markierungen

Die am 8. Oktober veröffentlichte Arbeit untersucht zehn KI-Suchen: ChatGPT, Perplexity, Google AI und Grok aus dem englischsprachigen Web sowie sechs chinesische Systeme. Das Manuskript trägt den Vermerk der Sicherheitskonferenz NDSS 2027. Die Untersuchung baut in drei Schritten aufeinander auf.

„AI search does not just surface sources; it also decides which published pages become visible evidence in the answer.“

Liu et al., From Public Posts to AI-Search Citations, 2026. Sinngemäß: KI-Suche zeigt nicht nur Quellen an, sie entscheidet auch, welche veröffentlichten Seiten in der Antwort als Beleg sichtbar werden.

Zur Begriffsklärung: In der GEO-Messung heißt es „Zitat“, wenn eine Seite als Quellenlink unter oder neben der KI-Antwort erscheint. Ob ihr Inhalt auch im Antworttext steht, ist damit noch nicht gesagt. Genau diesen Unterschied macht die Studie messbar.

Erstens sammelten die Forschenden 17.211 Zitate aus KI-Antworten, verteilt auf 6.356 Domains. Je nach System entfielen 20,5 bis 70,8 Prozent aller Zitate auf nur 20 Domains.

Zweitens prüften sie 22 häufig zitierte Veröffentlichungsplattformen: Bei 15 waren Registrierung und Veröffentlichung nur mit niedrigen oder mittleren Hürden verbunden.

Drittens folgte das eigentliche Experiment. Die Forschenden erfanden Begriffe, die es zuvor im Web nicht gab, und versahen ihre Beiträge mit eindeutigen Markierungen: ungewöhnliche Formulierungen und erfundene Kennzahlen. Taucht eine solche Markierung später in einer KI-Antwort auf, lässt sie sich eindeutig auf den Testbeitrag zurückführen. Innerhalb von sieben Tagen zitierten acht der zehn Systeme mindestens einen dieser Beiträge. Je nach System dauerte das zwischen einem und mehr als fünf Tagen.

Neben dem erfundenen Begriff testeten die Forschenden zwei weitere Themen: eine Debatte aus der Technologiebranche, über die im Netz schon viel geschrieben war (Meinungsthema), und ein erfundenes Produkt, abgefragt mit typischen Vergleichs- und Kauffragen (Produktthema). Dazu kam eine Wiederholung mit zehn weiteren erfundenen Themen.

Der eigentliche Befund

Verlinkt heißt nicht wiedergegeben

Die Studie hat zwei Dinge getrennt gemessen: ob ein Testbeitrag als Quelle verlinkt wurde und ob seine Markierungen im Antworttext erschienen. Beim erfundenen Begriff zeigt sich, wie unterschiedlich die Systeme damit umgehen:

Erfundener Begriff: Anteil der Antworten in % (gerundet)
als Quelle verlinktim Antworttext
94 %
53 %
Grok
45 %
6 %
Google AI
37 %
0 %
Perplexity
35 %
10 %
ChatGPT
63 %
32 %
Alle 10 Systeme

Antworten ab dem ersten Quellenlink des jeweiligen Systems, 20 bis 35 Antworten je System. Die Werte sind daher als Größenordnung zu lesen.

Bei Grok standen die markierten Inhalte in mehr als jeder zweiten Antwort. Perplexity verlinkte die Testbeiträge in gut jeder dritten Antwort, gab ihre Markierungen aber kein einziges Mal wieder. Auch das Thema spielt eine Rolle: Beim Meinungsthema wurden die Beiträge in 19 % der Antworten verlinkt und nur in 4 % wiedergegeben, beim Produktthema in 36 % und 5 %. Beide Themen kamen allerdings nur bei drei von zehn Systemen an; ChatGPT, Google AI und Grok zeigten hier keine Signale. Die Autoren vermuten, dass bereits vorhandene Diskussion im Netz die Wirkung neuer Beiträge verdünnt. In der Wiederholung mit zehn weiteren erfundenen Themen lagen beide Werte dagegen nah beieinander (32 % und 29 %).

Zwei Messpunkte, nicht einer
Beitrag veröffentlicht
Als Quelle verlinkt
Im Antworttext wiedergegeben
Entscheidung des Nutzers

Das berührt eine Grundannahme vieler Sichtbarkeitsberichte: Ein Quellenlink wird als Einfluss gewertet. Die Studie zeigt, dass beides je nach System und Thema fast gleichauf liegen oder weit auseinanderlaufen kann. Wer nur Links zählt, kann diese Fälle nicht unterscheiden. Für Unternehmen ist ohnehin die Aussage entscheidend, die Nutzer lesen – ein Preis, eine Produkteigenschaft, ein Vergleich.

Der zweite Befund

Der Ort zählt mehr als die Menge

In einem weiteren Versuch verglichen die Forschenden einzelne Beiträge auf einer bevorzugt zitierten Plattform mit vielen inhaltlich vergleichbaren Beiträgen auf selten zitierten Plattformen. In allen fünf Themenpaaren lieferte der einzelne Beitrag am bevorzugten Ort das erste Zitat. Auf der anderen Seite brauchte es im besten Fall 20 Beiträge für überhaupt ein Signal. Eine neu angelegte, selbst gehostete WordPress-Website blieb selbst nach 40 Beiträgen innerhalb einer Woche ohne Zitat.

Das passt zu dem, was wir zur Verteilung von KI-Zitaten auf wenige Plattformen beschrieben haben. Neu ist der experimentelle Nachweis: Nicht die Menge an Inhalten entscheidet, sondern ob sie dort stehen, wo ein bestimmtes System ohnehin sucht.

Welche Orte das sind, unterscheidet sich je nach System deutlich. Im Schnitt teilen zwei der untersuchten KI-Systeme nur etwa 7 ihrer 20 meistzitierten Domains. Eine Ausnahme sind Google AI und Grok, bei beiden steht Reddit auf Platz 1. Eine allgemeine Liste der „wichtigen Plattformen für KI-Sichtbarkeit“ greift deshalb zu kurz. Sinnvoller ist es, für die KI-Systeme, die die eigene Zielgruppe tatsächlich nutzt, getrennt zu erheben, welche Quellen sie heranziehen.

Was unter dem Etikett GEO verkauft wird

Zwei Produktlogiken unter einem Begriff

Die Forschenden haben außerdem 13 Anbieter untersucht, die sich ausdrücklich mit Sichtbarkeit in KI-Antworten bewerben, fünf aus dem englischsprachigen und acht aus dem chinesischen Markt. Die englischsprachigen Angebote bewerben vor allem Monitoring und Content-Erstellung. Ein Teil der chinesischen Anbieter bewirbt dagegen ausdrücklich das Verteilen von Beiträgen über Profile auf Medien- und Community-Plattformen.

Ein solches Angebot haben die Forschenden gekauft, im günstigsten Paket für 14 US-Dollar. Der Anbieter schrieb ihr Material um und veröffentlichte innerhalb von 28 Minuten 13 Beiträge auf fünf Plattformen, über bestehende Profile mit früheren Beiträgen zu ganz anderen Themen. Etwa eineinhalb Stunden nach der Zahlung zitierte eine chinesische KI-Suche einen dieser Beiträge, die Markierungen erschienen in der Antwort.

Der Anbieter hatte keinen Zugriff auf das KI-System. Er hat Inhalte dort platziert, wo das System häufig und schnell sucht. Das ähnelt eher Advertorial-Verteilung und Content-Seeding als dem, was wir unter GEO verstehen. Gleichzeitig ist es genau die Art Muster, die Plattformen zunehmend abwerten, wie der Fall im Insight „Machine-readable ist nicht machine-trusted“ zeigt. Die Autoren nennen selbst Erkennungsmerkmale: Profile mit abrupten Themenwechseln, fast identische Beiträge auf mehreren Plattformen, eng beieinanderliegende Veröffentlichungszeiten und auffällig schnelle Zitate neuer Seiten.

Was das für Unternehmen bedeutet

Der Befund hat zwei Seiten. Für die eigene Sichtbarkeit zeigt er, dass ein Zitat allein wenig über Einfluss aussagt. Für den Schutz der eigenen Marke zeigt er, dass Dritte mit geringem Aufwand Inhalte in die Quellenschicht einer KI-Suche bringen können, auch falsche Angaben über ein Unternehmen.

Im Insight zu Quellenvielfalt ging es darum, wie unabhängig die zitierten Quellen sind. Hier kommt eine zweite Frage dazu: Welche Aussage steht in der Antwort, und auf welche Quelle lässt sie sich zurückführen? Ein praktikabler Anfang sind fünf geschäftskritische Aussagen zur eigenen Marke, etwa zu Preisen, Produkteigenschaften, Sicherheitsangaben, Kündigungsbedingungen oder Vergleichen mit Wettbewerbern. Für jede davon regelmäßig festhalten:

  • den Wortlaut der Aussage in der KI-Antwort,
  • die zitierte URL und die Domain,
  • welches Profil oder welcher Autor hinter dem Inhalt steht – auf offenen Plattformen wie Reddit sagt die Domain darüber wenig,
  • ob es eine Primärquelle oder unabhängige Bestätigung gibt,
  • wann die Aussage erstmals auftauchte und ob sie sich auf weitere Systeme ausbreitet.

Löschen allein reicht dabei nicht immer. In einem Versuch über 15 Tage entfernten die Forschenden alle Testbeiträge nach Tag 11. Bei einzelnen Systemen tauchten Quellenlinks oder Markierungen danach weiter auf, teils wechselten sie sogar zu anderen Systemen. Wer eine falsche Angabe entfernen lässt, sollte die Antworten deshalb noch einige Tage weiter beobachten.

Wirtschaftlich relevant wird eine falsche Angabe vor allem dann, wenn die KI-Antwort das Anliegen des Nutzers überzeugend erledigt. Dann gibt es keinen Anlass mehr, die Angabe auf der Unternehmenswebsite zu prüfen.

Reality Check

Behauptung: „KI-Suchen lassen sich für 14 Dollar beliebig manipulieren.“

Einordnung: Die 14 Dollar beziehen sich auf einen einzigen Kauf bei einem Anbieter, mit einem Zitat in einem chinesischen KI-System. Die Autoren betonen selbst, dass sich daraus keine Erfolgsquote ableiten lässt – weder für andere Anbieter noch für andere Themen oder Systeme.

Behauptung: „Was als Quelle verlinkt wird, prägt die Antwort.“

Einordnung: Nicht automatisch. In einer Wiederholung mit zehn weiteren erfundenen Themen lagen Quellenlink und Wiedergabe zwar nah beieinander (32 % und 29 % der Antworten). Bei einzelnen Systemen und beim Meinungs- und Produktthema liefen sie aber weit auseinander. Ob eine verlinkte Quelle die Antwort prägt, muss man also für das jeweilige System und Thema prüfen.

Behauptung: „Eigene Inhalte auf der Firmenwebsite sind für KI-Suchen wertlos.“

Einordnung: Der Befund zu 40 Beiträgen ohne Zitat betrifft eine neu angelegte, selbst gehostete Website zu einem Nischenthema – keine etablierte Unternehmensdomain mit Geschichte und Verlinkung. Er zeigt, dass Menge allein wenig bewirkt, nicht dass die eigene Website keine Rolle spielt.

Behauptung: „Die Ergebnisse gelten für jedes Thema und jeden Markt.“

Einordnung: Getestet wurden überwiegend Themen ohne Konkurrenz, mit einem konstruierten Fragenset, in einer Kampagne im März und April 2026. Umkämpfte Produkt- oder Politikthemen hat die Studie ausdrücklich nicht untersucht. Die Systeme können sich seitdem verändert haben.

Die eigentliche Verschiebung

Die Studie belegt einen konkreten, günstigen Weg, neue Inhalte in die Quellen von KI-Suchen zu bringen. Sie belegt nicht, dass KI-Suchen beliebig manipulierbar sind. Die Forschenden haben ihre Ergebnisse allen zehn Plattformen gemeldet, mehrere haben den Eingang bestätigt. Die Abwehr dürfte sich also weiterentwickeln.

„Wer nur Quellenlinks zählt, misst die Fußnoten. Entscheidend ist der Antworttext: was dort über die eigene Marke steht und woher es kommt.“Dr. Michael Mohaupt, rethink.expert
Für die Praxis

Drei Konsequenzen für die eigene Messung

1

Zitate und in der Antwort wiedergegebene Aussagen getrennt erfassen. Eine hohe Zitierquote ist noch kein Beleg dafür, dass die eigenen Inhalte die Antwort prägen.

2

Für wichtige Aussagen zur eigenen Marke die Herkunft verfolgen: zitierte Quelle, Herausgeber, Primärbeleg und erstes Auftreten.

3

Bei GEO-Angeboten nachfragen, wo und über wessen Profile veröffentlicht wird und was gemessen wird – Zitate oder wiedergegebene Aussagen.

Häufige Fragen

Zitate, Antworttexte und Quellenmanipulation in KI-Suchen

Zehn Systeme: ChatGPT, Perplexity, Google AI und Grok aus dem englischsprachigen Web sowie Doubao, Wenxin, Yuanbao, DeepSeek, Kimi und Qwen. Beim erfundenen Begriff verlinkten nur Qwen und DeepSeek die Testbeiträge innerhalb von sieben Tagen nicht als Quelle. Beim Produktthema verlinkte Qwen dagegen am häufigsten.

Ein Quellenlink – in der GEO-Messung meist „Zitat“ genannt – bedeutet, dass ein Beitrag als Quelle verlinkt wurde. Wiedergegeben bedeutet hier, dass die eindeutigen Markierungen aus dem Beitrag im Antworttext erschienen. Je nach System und Thema lagen beide Werte nah beieinander oder weit auseinander.

Nein, so allgemein nicht. Für 14 Dollar kauften die Forschenden 13 Veröffentlichungen über ein bestehendes Netz von Profilen. Eine davon wurde in einem Einzelfall von einem chinesischen KI-System zitiert. Eine Erfolgsquote lässt sich daraus nicht ableiten.

Die Arbeit ist als arXiv-Preprint erschienen. Das Manuskript trägt den Vermerk der Sicherheitskonferenz NDSS 2027. Die Experimente stammen aus März und April 2026; die Systeme können sich seitdem verändert haben.

Aus welchen Quellen entsteht die Darstellung Ihrer Marke in KI-Antworten – und welche Aussagen stehen tatsächlich in der Antwort? Im GEO-Webinar zeigen wir, wie Sie das prüfen.

Platz im GEO-Webinar sichern →