Search ja, Training nein: Warum GEO eine neue Zugriffsschicht bekommt
Wer Content für generative Systeme optimiert, fragt meist zuerst, wie Inhalte beschaffen sein müssen, damit KI-Systeme sie finden, verstehen und zitieren. Davor liegt eine grundlegendere Frage: Darf ein KI-System den Content überhaupt erreichen – und wofür darf es ihn verwenden? Ab morgen, dem 15. September 2026, beantwortet Cloudflare genau diese Frage technisch, nicht mehr nur konzeptionell.
Zwei Zahlen, ein Muster: Eine Datei bereitzustellen ist nicht dasselbe wie genutzt zu werden – und der Großteil des KI-Crawling-Verkehrs dient längst nicht mehr der Auffindbarkeit, sondern dem Training.
- →Ab dem 15. September 2026 blockiert Cloudflare bei neuen, werbefinanzierten Websites KI-Crawler für Training und Agenten-Zugriffe standardmäßig – Search bleibt erlaubt. Bei Multi-Purpose-Crawlern wie Googlebot, Applebot oder BingBot greift die restriktivste Regel.
- →Getestet wird zusätzlich ein „Content-Signal“ in robots.txt, das Search, Training und drei Nutzungsstufen (immediate/reference/full) unterscheidet – bislang ein Präferenzsignal, keine durchgesetzte Norm.
- →Eine Ahrefs-Analyse von 137.000 Domains zeigt: 28 % haben eine llms.txt, aber 97 % dieser Dateien wurden im Studienzeitraum kein einziges Mal abgerufen.
- →Im Juni 2026 entfielen bereits 52 % der zweck-klassifizierten KI-Crawler-Anfragen auf Training, über 36 % auf Mixed-Use-Crawler – reines Search-Crawling ist die kleinste, schrumpfende Kategorie.
- →Eine Recherche zum Hosting-Anbieter WP Engine zeigt: Rate-Limiting auf Infrastrukturebene blockierte KI-Crawler unsichtbar für die Kunden – mit einer auffälligen, aber nicht bewiesenen Korrelation zur Zitierbarkeit bei einzelnen KI-Systemen.
Ein Bot ist nicht mehr einfach ein Bot
Cloudflare unterscheidet automatisierten Zugriff inzwischen nach Zweck. Drei Kategorien stehen im Mittelpunkt: Search (Crawling zur späteren Beantwortung von Suchanfragen), Agent (ein System ruft im Auftrag eines Nutzers live eine Seite auf) und Training (Inhalte werden zum Trainieren oder Fine-Tuning eines Modells verwendet). Ab dem 15. September 2026 gilt dafür ein neuer Standard – zunächst für Websites, die sich über Werbung finanzieren: Cloudflare begründet das mit dem Geschäftsmodell dieser Seiten. Wo menschliche Aufmerksamkeit die eigentliche Erfolgsmetrik ist – weil sie Werbeeinnahmen erzeugt –, werden Bots, die diese Aufmerksamkeit ersetzen könnten, standardmäßig ferngehalten: Training und Agent werden dann bei neu hinzukommenden Werbe-Websites blockiert, Search bleibt erlaubt.
Besonders relevant ist der Umgang mit Multi-Purpose-Crawlern. Nutzt ein Anbieter denselben Crawler für mehrere Zwecke – etwa Search und Training –, greift die restriktivste anwendbare Regel. Genannt werden dabei ausdrücklich Googlebot, Applebot und BingBot: Wählt ein Website-Betreiber „Training blockieren“, kann das auch Crawler betreffen, die eigentlich mehrere Funktionen gleichzeitig abwickeln.
Dazu kommt eine zweite Dimension: nicht nur, warum ein Bot eine Website besucht, sondern was anschließend mit dem Content geschehen darf. Getestet wird eine Erweiterung namens „Content-Signal“ in robots.txt, die zwischen drei Nutzungsstufen unterscheidet – immediate (nutzen, aber nicht speichern), reference (indexieren, auszugsweise verwenden, verlinken) und full (zusammenfassen und reproduzieren):
Wichtig: Das ist derzeit ein Präferenzsignal, keine universell durchgesetzte Norm des Webs – kein KI-System ist verpflichtet, es zu respektieren.
GEO beginnt vor dem Content
Der typische GEO-Prozess wird meist als Content → Retrieval → Generierung → Citation gedacht. Tatsächlich fehlt davor eine Ebene: ob ein System den Content technisch erreichen kann, und für welchen Zweck dieser Zugriff erlaubt ist.
Selbst wenn robots.txt einen Crawler zulässt, bedeutet das noch nicht, dass er die Inhalte tatsächlich abrufen kann. CDNs, Web Application Firewalls, Bot-Management und Rate-Limits können automatisierte Zugriffe zusätzlich einschränken. Eine Recherche zum Hosting-Anbieter WP Engine zeigt das anschaulich: Automatisches Rate-Limiting auf Infrastrukturebene blockierte unter anderem GPTBot und ClaudeBot per HTTP 429 – unsichtbar für die betroffenen Kunden, weil die Sperre unterhalb der üblichen Kontrollebenen ansetzt: Sie taucht weder in WordPress-Plugin-Logs noch in der eigenen Cloudflare-Zone der Kunden auf und lässt sich über kein Kundenportal-Setting einzeln abschalten, wie WP Engine auf Nachfrage bestätigte. An der untersuchten Website fiel dabei auf: Wo ein Crawler Zugriff hatte, tauchte die Website in den Antworten des jeweiligen KI-Systems auf – wo er blockiert war, verschwand sie fast vollständig. Nur bei Perplexity war der Zusammenhang uneindeutig: Trotz vollem Zugriff des PerplexityBot blieb die Zitat-Präsenz dort niedrig. Voller Zugriff allein garantiert also keine Zitate – fehlender Zugriff scheint sie aber zuverlässig zu verhindern. Der beste GEO-Content ist wertlos, wenn das relevante System ihn gar nicht erreicht.
Behauptung: „Eine llms.txt zu veröffentlichen ist mittlerweile ein etablierter GEO-Standard.“
Einordnung: Nicht belegt. In einer Ahrefs-Analyse von 137.000 Domains wurden 97 % der vorhandenen llms.txt-Dateien im Studienzeitraum kein einziges Mal abgerufen – eine Datei bereitzustellen ist nicht dasselbe wie von KI-Systemen genutzt zu werden.
Behauptung: „Das „Content-Signal“ in robots.txt ist eine verbindliche, durchgesetzte Web-Norm.“
Einordnung: Nein. Es wird ausdrücklich als Präferenzsignal beschrieben – kein KI-System ist verpflichtet, es zu respektieren.
Behauptung: „Die zitierte Recherche beweist, dass blockierter Bot-Zugriff generell zu einem Zitations-Einbruch führt.“
Einordnung: Nein. Der Autor selbst nennt die Korrelation „suggestive, not proof“ – sieben Tage Daten, eine einzelne Website, kein kontrolliertes Vorher-Nachher. Zusätzlich stammte fast der gesamte beobachtete „ClaudeBot“-Traffic von einer Microsoft-Azure-IP statt aus Anthropics offiziellen Bereichen – vermutlich ein Scraper mit gefälschter Kennung, kein echter Anthropic-Crawler.
Behauptung: „Wenn robots.txt einen Crawler erlaubt, kann er die Inhalte auch tatsächlich abrufen.“
Einordnung: Nicht zwangsläufig. CDNs, Firewalls, Rate-Limits und Bot-Management können Zugriffe zusätzlich einschränken – teils unsichtbar für den Website-Betreiber selbst.
Von der Ja/Nein-Frage zur Zugriffs-Matrix
Ein Hersteller kann ein hohes Interesse daran haben, dass Produktspezifikationen gefunden und korrekt referenziert werden. Ein Fachverlag will bei umfangreichen redaktionellen Inhalten womöglich stärker zwischen Auffindbarkeit, Zusammenfassung und vollständiger Wiederverwendung unterscheiden. Ein SaaS-Anbieter begrüßt Agentenzugriffe vielleicht ausdrücklich, wenn ein KI-Agent dadurch direkt mit dem eigenen Service interagieren kann. Pauschales Blockieren oder Erlauben wird keiner dieser Situationen gerecht.
Dahinter steckt eine ökonomische Verschiebung. Content gegen Traffic war die implizite Vereinbarung des klassischen Webs. Sichtbarkeit über Zugriffskontrolle schafft dagegen Verhandlungsmacht:
„Transparency created scarcity. Scarcity created leverage.“ — Cloudflare
Mehr als 50 Publisher-KI-Vereinbarungen sind seit 2023 zustande gekommen – ein Indiz dafür, dass sich die Debatte von „ob“ zu „wie“ Content-Zugriff vergütet wird verschiebt.
Prüfen, welche KI-Crawler tatsächlich zugreifen – und welche davon durch robots.txt, CDN, Firewall oder Rate-Limits eingeschränkt werden.
Nach Zweck unterscheiden statt pauschal zu blockieren: Search, Agent und Training können für dasselbe Unternehmen unterschiedlich sinnvoll sein.
Server-Logs statt nur Konfiguration prüfen – zwischen deklarierter Zugänglichkeit und tatsächlicher Nutzung kann eine erhebliche Lücke liegen.
Für welche KI-Nutzung wollen wir sichtbar sein?
Im generativen Web kann derselbe Content mindestens vier unterschiedliche Funktionen erfüllen: gefunden, referenziert, zur Beantwortung einer Anfrage verwendet oder zum Training eines Modells genutzt werden – mit unterschiedlichem wirtschaftlichem Wert für den Anbieter. Die technische Infrastruktur des Webs beginnt gerade erst, diese vier Funktionen voneinander zu trennen, und kein KI-System ist verpflichtet, dieselben Signale zu respektieren. Trotzdem verschiebt sich die GEO-Grundfrage: nicht mehr nur „Wie machen wir unseren Content für KI sichtbar?“, sondern „Für welche KI-Nutzung wollen wir sichtbar sein?“.
Dieselbe ökonomische Frage wie beim Doom Loop
Der Insight „Der Doom Loop der KI-Suche“ beschreibt, wie fehlende direkte Interaktion langfristig die wirtschaftliche Grundlage von Inhalten schwächen kann. Access Governance liefert dafür einen technischen Hebel: Wer Zugriff nach Zweck differenziert, entscheidet auch mit, welcher Teil dieser Wertschöpfungskette dem eigenen Unternehmen erhalten bleibt.
Kurz beantwortet
Statt Bots pauschal zu erlauben oder zu blockieren, wird zwischen Search (Auffindbarkeit), Agent (Live-Zugriff im Auftrag eines Nutzers) und Training (Modelltraining) unterschieden. Ein Unternehmen kann so etwa Auffindbarkeit erlauben, Training aber ausschließen.
Die Datei allein garantiert keine Nutzung. Eine Ahrefs-Analyse von 137.000 Domains zeigt, dass 97 % der vorhandenen llms.txt-Dateien im Studienzeitraum kein einziges Mal abgerufen wurden. Sie kann ein experimenteller Baustein sein, ersetzt aber weder technische Erreichbarkeit noch die Analyse realer Crawler-Zugriffe.
Nein. Selbst wenn robots.txt einen Crawler zulässt, können CDNs, Firewalls, Bot-Management oder Rate-Limits den tatsächlichen Zugriff zusätzlich einschränken – teils ohne dass der Website-Betreiber es bemerkt.
Welche KI-Crawler tatsächlich in den Server-Logs auftauchen, welche davon durch bestehende Infrastruktur eingeschränkt werden, und ob die eigene Konfiguration Search, Agent und Training überhaupt unterschiedlich behandelt – statt alle KI-Systeme gleich zu behandeln.
Wie Sie Zugriffssteuerung und Content-Strategie als Teil derselben GEO-Entscheidung denken: das zweitägige GEO-Webinar.
Platz im GEO-Webinar sichern →
