Zum Hauptinhalt springen
Technisches SEO

GPTBot, ClaudeBot, PerplexityBot: Zugriff steuern

24. September 2026 · 11 Min. Lesezeit

Sie steuern den Zugriff von KI-Crawlern über die robots.txt, und zwar pro User-Agent. Der entscheidende Punkt dabei wird in fast jeder Anleitung übergangen: Ein Anbieter betreibt meist mehrere Bots mit völlig verschiedenen Aufgaben. Wer sie über einen Kamm schert und pauschal alles sperrt, nimmt sich die Sichtbarkeit in der KI-Suche mit, obwohl er eigentlich nur das Modell-Training verhindern wollte.

Dieser Artikel listet die Bots nach Betreiber, erklärt, welcher wofür zuständig ist, und liefert eine robots.txt zum Kopieren für den häufigsten Fall: Training draußen, Suche und Zitate drinnen. Dazu die unbequemen Teile, die selten dabeistehen, nämlich was die Datei nicht kann und wie Sie im Zugriffsprotokoll nachmessen, ob die Bots überhaupt vorbeikommen.

Ein Betreiber, mehrere Bots: der Unterschied, auf den es ankommt

Nehmen Sie OpenAI. Dort laufen drei Bots mit klar getrennten Aufgaben. GPTBot sammelt Inhalte, die in das Training künftiger Modelle einfließen können. OAI-SearchBot baut den Index für die Suche in ChatGPT auf, er trainiert nichts. Und ChatGPT-User ist gar kein klassischer Crawler: Er ruft eine einzelne Seite dann ab, wenn ein Nutzer im Gespräch danach fragt oder einen Link teilt.

Wer alle drei sperrt, ist danach aus der ChatGPT-Suche verschwunden. Die eigenen Seiten tauchen nicht mehr als Quelle auf, und wenn jemand die URL direkt in den Chat wirft, bekommt er eine Fehlermeldung statt einer Zusammenfassung. Wer dagegen nur GPTBot sperrt, bleibt in der Suche sichtbar und hält trotzdem die Trainingsdaten zurück. Das ist derselbe Klick Aufwand und ein völlig anderes Ergebnis.

Wie sich das anfühlt, merkt man erst im Ernstfall. Ein Kunde aus dem Anlagenbau hatte im Frühjahr die Sammelsperre eines Sicherheits-Plugins aktiviert, ohne die Einträge zu lesen. Aufgefallen ist es Monate später, als der Vertrieb sich wunderte, warum ChatGPT bei einer Produktfrage den Wettbewerber nannte und die eigene, deutlich ausführlichere Seite nicht. Die robots.txt war die einzige Ursache, und die Korrektur bestand aus dem Löschen von vier Zeilen.

Dasselbe Muster finden Sie bei fast jedem großen Anbieter, und es ist der einzige Grund, warum dieser Artikel überhaupt nötig ist. Perplexity trennt PerplexityBot vom nutzergetriebenen Perplexity-User. Anthropic trennt den crawlenden ClaudeBot vom Such-Bot und vom Abruf im Gespräch. Google trennt Googlebot von der Kennung Google-Extended. Die verbreitete Copy-Paste-Liste „alle KI-Bots blockieren", die durch Foren geistert, kennt diese Trennung nicht.

Die wichtigsten KI-Crawler nach Betreiber

Die folgende Übersicht nennt die Bots, die Sie in den Protokollen einer normalen Firmenwebsite tatsächlich zu sehen bekommen. Bot-Namen ändern sich, kommen dazu und verschwinden. Verbindlich ist immer die Dokumentation des jeweiligen Betreibers, bei OpenAI etwa die Übersicht der OpenAI-Crawler, bei Google die Liste der Google-Crawler.

  • OpenAI. GPTBot für Trainingsdaten, OAI-SearchBot für den Suchindex hinter ChatGPT, ChatGPT-User für Abrufe, die ein Nutzer im Gespräch auslöst.
  • Anthropic. ClaudeBot als allgemeiner Crawler, Claude-SearchBot für die Suche, Claude-User für den Abruf während einer Unterhaltung. In älteren Listen stehen noch anthropic-ai und Claude-Web, beide sind überholt und schaden in der robots.txt nicht, nützen aber auch nichts.
  • Perplexity. PerplexityBot indexiert für die Antworten, Perplexity-User holt eine Seite auf konkrete Nachfrage eines Nutzers.
  • Google. Googlebot ist der normale Suchmaschinen-Crawler und speist zugleich die AI Overviews. Google-Extended ist kein eigener Crawler, sondern eine Kennung, mit der Sie die Nutzung für Gemini und generative APIs abbestellen. Wichtig daran: Google-Extended nimmt Sie nicht aus den AI Overviews, denn die gehören zur Suche. Wer da raus will, müsste Googlebot sperren, und damit die organische Sichtbarkeit gleich mit.
  • Apple. Applebot beliefert Siri und Spotlight, Applebot-Extended ist wie bei Google nur eine Kennung zum Abbestellen des Trainings.
  • Meta. meta-externalagent crawlt für Training und Produkte, meta-externalfetcher holt Seiten auf Nutzeraktion.
  • Sammler und Sonstige. CCBot gehört zu Common Crawl, dessen Datensätze wiederum in zahllose Trainingsläufe eingehen. Bytespider stammt von ByteDance, Amazonbot von Amazon. Diese Gruppe ist der Teil, den die meisten Betreiber tatsächlich draußen haben wollen.

Zwei Fälle fehlen in der Liste, weil sie sich nicht sauber steuern lassen. Microsoft bündelt Suche und Copilot hinter bingbot; einen eigenen Bot, den Sie für die KI-Antworten sperren könnten, ohne die Bing-Suche zu verlieren, gibt es nicht. Und kleinere Anbieter wie Mistral oder Cohere schicken zwar eigene Kennungen los, tauchen bei durchschnittlichem Traffic aber so selten auf, dass eine Zeile in der robots.txt nichts bewegt. Nehmen Sie sie auf, wenn Sie sie im Protokoll sehen, nicht vorher.

Eine Sache noch, die oft für Enttäuschung sorgt: Eine Sperre wirkt nur nach vorne. Was ein Modell bereits gelernt hat, verschwindet nicht, weil Sie heute GPTBot aussperren. Sie verhindern den nächsten Trainingslauf, nicht den letzten. Wie ein einzelner dieser Crawler in der Praxis arbeitet, welche Inhalte er mitnimmt und welche er liegen lässt, haben wir am Beispiel von Anthropic ausführlicher beschrieben: wie Claude Webinhalte erfasst.

Eine robots.txt zum Kopieren

Der häufigste Fall in der Beratung lautet: Das Modell soll nicht mit meinen Texten trainiert werden, in ChatGPT und Perplexity will ich aber als Quelle auftauchen. Genau dafür ist die folgende Datei gedacht. Sie kommt ins Wurzelverzeichnis, also unter https://ihre-domain.de/robots.txt.

# Training: nein
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: meta-externalagent
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

# Suche und Zitate: ja
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Applebot
Allow: /

# Alle anderen
User-agent: *
Allow: /
Disallow: /intern/

Sitemap: https://ihre-domain.de/sitemap.xml

Sieben User-Agents stehen auf der Sperrliste, sieben auf der Freigabeliste. Zwei Dinge dazu, die Sie wissen sollten. Erstens: Die Allow-Blöcke ändern technisch nichts, weil ohnehin alles erlaubt ist, was nicht verboten wurde. Sie stehen da als Dokumentation für den nächsten Menschen, der die Datei öffnet, und das ist ihr Wert. Zweitens, und das ist der Fallstrick: Ein Crawler befolgt nur die Gruppe, die am genauesten auf ihn passt. Steht unten im Stern-Block ein Disallow: /intern/, gilt das für GPTBot nicht mehr, sobald er einen eigenen Block hat. Regeln werden zwischen Gruppen nicht vererbt.

Praxis-Tipp: Legen Sie die Sperren erst an, wenn die Datei sonst fehlerfrei ist. Ein Tippfehler im Pfad einer Zeile kann den ganzen Block ungültig machen, und robots.txt-Dateien werden selten wieder angesehen. Der Aufbau der Datei, die erlaubten Direktiven und die typischen Fehler stehen in unserem Grundlagenartikel zu den Direktiven der robots.txt.

Die Schreibweise der Bot-Namen dürfen Sie entspannt sehen, beim Abgleich des User-Agents wird Groß- und Kleinschreibung ignoriert. Die Pfade dahinter nicht: /Intern/ und /intern/ sind zwei verschiedene Verzeichnisse. Prüfen Sie nach dem Hochladen im Browser, ob die Datei unter der Adresse wirklich erscheint und als reiner Text ausgeliefert wird. Wir haben mehr als einmal eine hübsch geschriebene robots.txt gesehen, die hinter einer Weiterleitung lag oder von einem Plugin dynamisch überschrieben wurde. Eine Datei, die der Bot nicht sauber lesen kann, behandelt er wie eine Datei, die es nicht gibt, und dann ist alles erlaubt.

Was in dieser Datei bewusst fehlt, ist eine Empfehlung für llms.txt. Die Datei gehört in eine andere Kategorie, sie sperrt nichts, sondern empfiehlt Inhalte, und wie viel sie derzeit wirklich bringt, haben wir gemessen und aufgeschrieben: was llms.txt leistet und was nicht.

robots.txt ist eine Bitte, keine Sperre

Hier trennt sich der Wunsch von der Technik. Die robots.txt ist eine Textdatei, die ein Crawler abrufen kann. Ob er sich danach richtet, entscheidet er selbst. Es gibt keine technische Durchsetzung, kein Protokoll, keinen Rückkanal, keine Konsequenz. Die großen Anbieter halten sich daran, weil ein öffentlicher Regelbruch teuer wäre. Cloudflare veröffentlichte im August 2025 eine Untersuchung, nach der ein KI-Anbieter Seiten über nicht deklarierte Kennungen abgerufen haben soll; der Anbieter widersprach. Genau darum geht es: Sie können es nicht erzwingen, Sie können es nur beobachten.

Wer wirklich sperren will, muss das auf dem Server tun. Auf Apache-Hosting sieht die einfachste Variante so aus:

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} (GPTBot|CCBot|Bytespider) [NC]
RewriteRule ^ - [F,L]

Der Preis dafür steht in Zeile zwei. Diese Regel prüft nur die Zeichenkette, mit der sich ein Bot ausgibt. Wer sich als normaler Browser meldet, läuft durch. Ausgesperrt werden also zuverlässig genau die, die sich ohnehin an die robots.txt gehalten hätten. Echte Durchsetzung geht nur über die veröffentlichten IP-Bereiche der Anbieter oder eine vorgelagerte Firewall, und dort schießen Sie schnell über das Ziel hinaus: Eine zu grobe Regel trifft irgendwann Googlebot, Monitoring-Dienste oder Ihren eigenen Seitenprüfer. Wie eng Crawl-Steuerung und Auffindbarkeit zusammenhängen, zeigt das Zusammenspiel aus Sitemap, Indexierung und Crawl-Steuerung.

Nachmessen im Zugriffsprotokoll

Alles bisher Geschriebene ist Theorie, solange Sie nicht wissen, wer bei Ihnen tatsächlich klopft. Das steht im Zugriffsprotokoll Ihres Servers, es kostet nichts und ist die einzige Messung, die wirklich etwas beweist. Bei den meisten Hostern liegen die Dateien in einem Ordner logs, tageweise und oft gepackt. Ein Befehl reicht:

grep -oiE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|Applebot|Amazonbot|Bytespider|CCBot' access.log \
  | sort | uniq -c | sort -rn

Für gepackte Tagesdateien setzen Sie zcat *.gz | davor und lassen den Dateinamen weg. Heraus kommt eine Liste mit Häufigkeiten, und die ist meistens überraschend. Bei kleineren Firmenseiten sehen wir regelmäßig eine zweistellige Zahl von GPTBot-Zugriffen pro Woche, während OAI-SearchBot bei null steht. Das ist ein handfester Befund: Die Seite liefert Trainingsmaterial und taucht in der Suche trotzdem nicht auf, meistens weil sie schlicht nirgends verlinkt ist.

Gut zu wissen: Die Kennung im Protokoll lässt sich fälschen. Wenn eine Zahl unplausibel hoch aussieht, prüfen Sie die IP-Adressen gegen die Bereiche, die der Betreiber veröffentlicht. Ohne diesen Abgleich sagt ein User-Agent nur, wofür sich jemand ausgibt.

Aus dem Ergebnis folgt die Arbeit. Steht ein Trainings-Bot ganz oben, den Sie nicht wollen, greift die Sperre aus dem Abschnitt oben. Steht ein Such-Bot bei null, obwohl Sie ihn erlauben, liegt es nicht an der robots.txt, sondern an fehlenden Verweisen von außen. Und wenn ein einzelner Bot dieselbe Seite hundertfach am Tag holt, ist das kein Sichtbarkeitsproblem, sondern eine Frage der Serverlast. Die Direktive Crawl-delay hilft da nur bedingt, Google ignoriert sie vollständig und andere Bots halten sich unterschiedlich daran; verlässlich bremsen Sie nur auf dem Server. Drei Befunde, drei völlig verschiedene Maßnahmen, und ohne die Zahlen raten Sie.

Legen Sie sich den Befehl auf einen Monatsrhythmus. Erst dann sehen Sie, ob eine Änderung an der robots.txt überhaupt gewirkt hat, und das dauert nach unserer Erfahrung zwischen wenigen Tagen und mehreren Wochen, weil manche Bots die Datei nur selten neu abrufen.

Alles sperren? Meist die falsche Entscheidung

Jetzt die eine Meinung, die Sie hier bekommen: Ein pauschales Verbot für sämtliche KI-Crawler halte ich für falsch, jedenfalls für Unternehmen, die über ihre Website neue Kunden gewinnen wollen. Sie tauschen einen Vorteil, den Sie messen können, gegen einen Schaden, den Sie nicht beziffern können. Der Vorteil ist Sichtbarkeit in Systemen, die zunehmend die erste Station einer Recherche sind. Der Schaden ist, dass ein Modell irgendwann Formulierungen kennt, die von Ihrer Leistungsseite stammen. Bei einem Handwerksbetrieb aus der Region wiegt das eine sehr viel schwerer als das andere. Unsere eigene robots.txt sperrt deshalb keinen einzigen dieser Bots.

Es gibt gute Gründe für die Gegenposition, und sie hängen fast immer daran, dass der Inhalt selbst das Produkt ist. Ein Fachverlag, eine Datenbank hinter einer Paywall, ein Archiv mit Bildrechten Dritter, eine Redaktion, die Lizenzverträge verhandelt: Dort ist jede kostenlos abgegriffene Seite verlorener Umsatz, und dort ist die Sperre richtig. Auch wer Nutzerinhalte hostet und in der Verantwortung für fremde Texte steht, hat einen Grund. Für die Website einer Steuerkanzlei oder eines Maschinenbauers gilt das nicht.

Was in beiden Fällen zählt, ist die Trennung von oben. Sperren Sie das Training, wenn Sie es sperren wollen. Aber lassen Sie die Such- und Abruf-Bots durch, solange Sie gefunden werden möchten.

Fazit

KI-Crawler steuern heißt nicht „an oder aus", sondern pro Bot entscheiden. GPTBot, ClaudeBot und PerplexityBot sind Trainings- und Index-Crawler, ihre Geschwister OAI-SearchBot, Claude-SearchBot und Perplexity-User entscheiden über Ihre Sichtbarkeit in KI-Antworten. Legen Sie die robots.txt entsprechend an, und prüfen Sie einen Monat später im Zugriffsprotokoll nach, ob sie befolgt wird.

Wer crawlt Ihre Website wirklich?

Wir prüfen robots.txt, Serverregeln und Zugriffsprotokolle und sagen Ihnen, welche Bots durchkommen und welche Sie kosten.

Technisches Audit anfragen
09 · Kontakt

Reden wir über
Platz 1 für Ihre Firma.

Wählen Sie kurz aus, was Sie brauchen. Wir melden uns mit einer ehrlichen Einschätzung in 24 Stunden. Kein Verkaufs­gespräch, keine Werbung.

09129 1439894
20+ Jahre Nürnberg Keine Vertragsbindung Mo-Fr 9-18 · kein Call-Center