26 % der führenden Websites blockieren KI-Crawler
Von Philipp Kant 5 Min. Lesezeit
Das Blockieren von KI-Crawlern ist eine „robots.txt“-Richtlinie, die bestimmten KI- Bots das Crawlen einer Website untersagt. Am 26. August 2026 haben wir die „robots.txt“-Dateien der 800 am häufigsten verlinkten Domains im Web (Majestic Million-Ranking) untersucht. Das Ergebnis: 26,6 % dieser Websites blockieren mindestens einen KI-Crawler vollständig, und die Aufteilung zwischen Trainings-Bots und Such-Bots ist besonders interessant.
Wie viele Websites blockieren KI-Crawler?
Von den 800 Domains lieferten alle eine auswertbare robots.txt-Datei. Ein Crawler gilt
als blockiert, wenn seine eigene User-Agent-Gruppe den Eintrag Disallow: / enthält.
| KI-Crawler | Betreiber | Vollständig blockiert |
|---|---|---|
| CCBot | Common Crawl | 20,8 % |
| GPTBot | OpenAI (Training) | 19,2 % |
| ClaudeBot | Anthropic | 18,5 % |
| Bytespider | ByteDance | 18,2 % |
| meta-externalagent | Meta AI | 15,9 % |
| PerplexityBot | Perplexity | 15,0 % |
| Applebot-Extended | Apple | 14,6 % |
| anthropic-ai | Anthropic | 14,1 % |
| Amazonbot | Amazon | 13,5 % |
| claude-web | Anthropic (älter) | 12,4 % |
| facebookbot | Meta | 11,0 % |
| chatgpt-user | OpenAI (Browse) | 10,9 % |
| Google-Extended | Google (Training) | 16,6 % |
| OAI-SearchBot | OpenAI (Suche) | 8,0 % |
Ein Drittel der Websites (33,2 %) befasst sich in irgendeiner Form mit KI-Bots. Zwei Drittel (66,8 %) enthalten keinerlei KI-spezifische Regeln, was bedeutet, dass deren Inhalte standardmäßig jedem Trainer zur Verfügung stehen.
Welche großen Websites blockieren GPTBot?
154 der 800 Domains blockieren GPTBot vollständig. Der Anfang dieser Liste liest sich wie eine Übersicht über die Inhalteigentümer:
- Instagram (#4)
- TikTok (#22)
- Vimeo (#27)
- WhatsApp (#28)
- Amazon (#30)
- Yahoo (#52)
- Spotify (#60)
- New York Times (#67)
- Medium (#71)
- SoundCloud (#74)
- Forbes (#75)
- BBC (#94)
- CNN (#97)
Abonnement- und Datengeschäfte dominieren. Es handelt sich hierbei um Unternehmen, deren Inhalte kostenpflichtig sind; daher ist die Frage der Weiterbildung für sie eine Frage der Einnahmen.
Trainings-Bots werden blockiert, Such-Bots sind weiterhin willkommen
Das deutlichste Signal in den Daten ist die Asymmetrie innerhalb der Bot-Familie eines Unternehmens. OpenAI betreibt einen Trainings-Crawler (GPTBot, zu 19,2 % blockiert) und einen Such-Crawler (OAI-SearchBot, zu 8,0 % blockiert). Websites blockieren den Trainercrawler mehr als doppelt so häufig wie den Suchcrawler.
Diese Aufteilung ist bewusst und rational gewählt. Durch das Blockieren des Trainingsbots wird verhindert, dass Ihre Inhalte in zukünftige Modellgewichte einfließen, während ChatGPT Search weiterhin frei zitieren und Traffic weiterleiten kann. „Google-Extended“ (16,6 %) funktioniert auf dieselbe Weise für das Gemini-Training, ohne die Indizierung durch die Google-Suche zu beeinflussen.
Sollten Sie in diesem Jahr eine „robots.txt“-Regel festlegen, entscheiden Sie sich bitte für eine der beiden Kategorien, anstatt ein pauschales Verbot zu verhängen.
Die Datei „llms.txt“ ist auf 13 % der Top-Websites vorhanden
Der vorgeschlagene Standard „llms.txt“ taucht bei 12,9 % der gescannten Domains auf. Zum Vergleich: „sitemap.xml“-Angaben in der „robots.txt“-Datei sind auf professionellen Websites nahezu allgegenwärtig. Betrachten Sie „llms.txt“ als kostengünstige Option und nicht als Hebel: Google hat erklärt, dass dies derzeit für LLMs keine Rolle spielt, und unsere Zahlen zeigen, dass die Nutzung selbst unter großen Verlagen nach wie vor eine Nische darstellt.
Wie wir gemessen haben
- Stichprobe: die 800 führenden Domains aus dem „Majestic Million“ (einem auf Backlinks basierenden globalen Ranking), abgerufen am 26. August 2026.
- Die
/robots.txt-Datei jeder Domain wurde abgerufen und nach User-Agent- Gruppen analysiert. Ein Bot gilt als „vollständig blockiert“, wenn seine GruppeDisallow: /enthält, und als „teilweise eingeschränkt“, wenn seine Gruppe andereDisallow-Pfade auflistet. Teilweise Einschränkungen sind in den oben genannten Prozentsätzen nicht berücksichtigt. - Die Datei
/llms.txtwurde separat abgefragt und gezählt, sofern sie Nicht-HTML-Inhalte zurückgab. - Einschränkungen: X-Robots-Tag-Header, Firewall-Regeln und JavaScript- Sperren sind für diese Methode nicht erkennbar. Die tatsächlichen Blockierungsraten sind wahrscheinlich etwas höher. 287 weitere Domains wurden übersprungen, da sie innerhalb des Zeitlimits keine auswertbare robots.txt bereitstellten.
- Rohdaten: ai-crawler-blocking-2026.csv, eine Zeile pro Domain, eine Spalte pro Bot.
Sollten Sie KI-Crawler auf Ihrer Website blockieren?
Entscheiden Sie über die beiden Kategorien getrennt. Wenn das Trainieren des Modells anhand Ihrer Inhalte akzeptabel ist, lassen Sie GPTBot und Google-Extended unverändert und halten Sie OAI-SearchBot offen, damit ChatGPT Search auf Sie verweisen kann. Falls Ihre Inhalte kostenpflichtig sind, blockieren Sie die Trainer und überlegen Sie sich genau, wie Sie mit Suchenden umgehen wollen. In jedem Fall sollten Sie abschätzen, welche Einbußen Ihnen entstehen, bevor Sie die Entscheidung treffen: Führen Sie Ihre Domain durch den AI Visibility Check , um zu prüfen, ob KI-Suchmaschinen Sie derzeit zitieren.
Die Datei „llms.txt“ ist auf 13 % der Top-Websites vorhanden
Der vorgeschlagene llms.txt-Standard taucht bei 12,9 % der gescannten
Domains auf. Zum Vergleich: sitemap.xml-Angaben in der robots.txt sind
auf professionellen Websites nahezu allgegenwärtig. Betrachten Sie „llms.txt“ als kostengünstige
Option und nicht als Hebel: John Mueller von Google hat erklärt, dass die Datei
LLMs derzeit nicht helfen kann (Search Engine Journal),
und unsere Zahlen zeigen, dass die Nutzung selbst bei großen
Verlagen nach wie vor eine Nische darstellt.
Häufig gestellte Fragen
Wie viel Prozent der Websites blockieren GPTBot?
Bei unserer Analyse der 800 am häufigsten verlinkten Domains blockieren 19,2 % den GPTBot in der robots.txt vollständig. Ein weiterer Teil beschränkt den Zugriff auf bestimmte Pfade.
Wird meine Website durch das Blockieren von GPTBot aus der ChatGPT-Suche entfernt?
Nein. ChatGPT Search nutzt OAI-SearchBot, bei dem es sich um einen separaten Crawler handelt. Das Blockieren von GPTBot unterbindet die Nutzung zu Trainingszwecken, das Blockieren von OAI-SearchBot unterbindet die Suche nach Zitaten. Es handelt sich um voneinander unabhängige Schalter.
Lohnt es sich, die Datei „llms.txt“ hinzuzufügen?
Es dauert nur wenige Minuten und verursacht keinerlei Probleme. Google hat erklärt, dass dies derzeit für große Sprachmodelle (LLMs) nicht hilfreich ist, und nur 12,9 % der Top-Websites setzen ein solches Modell ein. Passen Sie Ihre Erwartungen entsprechend an.
Wie kann ich überprüfen, ob meine Website KI-Crawler blockiert?
Öffnen Sie https://your-domain.com/robots.txt und suchen Sie in einer beliebigen
User-agent-Gruppe nach Ihrem Namen. Oder führen Sie den
AI-Sichtbarkeitscheck durch und lesen Sie den
Abschnitt „Crawler-Zugriff“ im Ergebnis.
Möchten Sie denselben Überblick für Ihre eigene Website, einschließlich der Ergebnisse zu Einwilligungen und Sicherheit über „robots.txt“ hinaus? Sprechen Sie uns an.