GPTBot, ClaudeBot & Co: KI-Crawler richtig steuern
KI-Crawler auf der Maklerwebsite: Welcher Bot was tut, wie du Sichtbarkeit und Modelltraining trennst – mit kopierfertiger robots.txt und llms.txt-Vorlage.
Niklas Schwerin
Co-Founder & KI-Stratege
Kurz gesagt:
- Die Anbieter unterscheiden selbst zwischen Crawlern, die dich sichtbar machen, und solchen, die Trainingsdaten sammeln. Wer alles sperrt, verliert nur das Erste.
- OpenAI dokumentiert vier Bots, Anthropic drei, Perplexity zwei. Google trennt Suche und Modelltraining über Google-Extended.
- Google hält ausdrücklich fest: Ein gesperrter Google-Extended beeinflusst weder die Aufnahme in die Google-Suche noch das Ranking dort.
- llms.txt ist eine Empfehlung von Jeremy Howard, kein verbindlicher Standard. Die KI-Anbieter veröffentlichen selbst welche, sagen aber nirgends zu, fremde zu lesen.
- Der häufigste Fehler ist keine Entscheidung, sondern ein Versehen: eine Sicherheitseinstellung oder ein Baukasten, der KI-Bots pauschal blockt.
Es gibt eine Datei auf deiner Website, die du vermutlich noch nie geöffnet hast, und sie entscheidet gerade darüber, ob ChatGPT dein Büro kennt.
Sie heißt robots.txt, liegt im Wurzelverzeichnis, und in den meisten Maklerprojekten hat sie zuletzt jemand angefasst, als die Seite gebaut wurde. Seitdem ist eine ganze Klasse neuer Besucher dazugekommen, für die niemand eine Regel geschrieben hat – Teil derselben Verschiebung, die GEO von SEO trennt.
Dieser Artikel klärt, welcher Bot was tut, warum die pauschale Blockade fast immer die falsche Antwort ist, und gibt dir eine robots.txt zum Kopieren. Plus eine ehrliche Einordnung zu llms.txt, um die gerade mehr Aufhebens gemacht wird, als die Faktenlage hergibt.
Wie prüfe ich, welche KI-Crawler meine Website erreichen dürfen?
Ruf deine-domain.de/robots.txt im Browser auf. Die Datei ist öffentlich und in Klartext lesbar. Steht dort User-agent: * gefolgt von Disallow: /, ist alles gesperrt. Findest du Einträge wie GPTBot oder OAI-SearchBot mit Disallow, wurden KI-Crawler gezielt ausgeschlossen. Steht gar nichts zu KI-Bots drin, gilt die allgemeine Regel.
Das dauert dreißig Sekunden und ist der erste Schritt jeder GEO-Bestandsaufnahme.
Die Bots, um die es geht
Die wichtigste Erkenntnis vorweg: Es gibt nicht „den KI-Bot". Die Anbieter betreiben mehrere, für verschiedene Zwecke, und sie dokumentieren das offen.
| Bot | Anbieter | Wofür laut Anbieter | Sperren kostet dich |
|---|---|---|---|
OAI-SearchBot |
OpenAI | Macht Websites in den Suchfunktionen von ChatGPT sichtbar | Sichtbarkeit in ChatGPT |
ChatGPT-User |
OpenAI | Ruft Seiten ab, wenn ein Nutzer konkret danach fragt | Abrufbarkeit im Gespräch |
GPTBot |
OpenAI | Sammelt Inhalte, die für das Training der Modelle genutzt werden können | nichts an Sichtbarkeit |
OAI-AdsBot |
OpenAI | Prüft Seiten, die als Anzeige eingereicht werden | nur relevant bei Anzeigen |
Claude-SearchBot |
Anthropic | Verbessert die Qualität von Suchergebnissen | Sichtbarkeit in Claude |
Claude-User |
Anthropic | Seitenabruf bei konkreten Nutzerfragen | Abrufbarkeit im Gespräch |
ClaudeBot |
Anthropic | Sammelt Webinhalte für das Modelltraining | nichts an Sichtbarkeit |
PerplexityBot |
Perplexity | Macht Websites in Perplexity sichtbar und verlinkt sie, ausdrücklich nicht für Modelltraining | Sichtbarkeit in Perplexity |
Perplexity-User |
Perplexity | Seitenabruf bei konkreten Nutzerfragen | Abrufbarkeit im Gespräch |
Google-Extended |
Steuert Nutzung für Gemini-Training und Grounding | nichts in der Google-Suche |
Die letzte Zeile verdient eine eigene Erwähnung, weil sich daran ein hartnäckiger Irrtum festmacht. Google schreibt in seiner Dokumentation ausdrücklich: „Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search." Du kannst also das Modelltraining unterbinden, ohne deine Google-Rankings zu gefährden. Wer dir etwas anderes erzählt, hat die Quelle nicht gelesen.
Kurzfazit: Suchcrawler und Trainingscrawler sind getrennt und einzeln steuerbar. Die pauschale Sperre wirft die Sichtbarkeit weg und behält nichts.
Der Fehler, der fast immer unabsichtlich passiert
In der Praxis sehe ich selten eine bewusste Entscheidung gegen KI-Sichtbarkeit. Was ich sehe, sind drei Versehen.
Das Sicherheits-Plugin. Viele Schutz-Erweiterungen haben inzwischen eine Option namens „Block AI Bots" oder ähnlich, teils standardmäßig aktiv. Sie blockt in der Regel alles, was nach KI aussieht – inklusive der Suchcrawler.
Der Baukasten. Manche Anbieter setzen eigene robots.txt-Regeln, die du nicht siehst und teils nicht ändern kannst. Wenn dein Baukasten die Datei überschreibt, hilft die schönste eigene Version nichts. Prüfen, nicht annehmen.
Der Netzwerk-Schutz. Content-Delivery-Netzwerke bieten ebenfalls Ein-Klick-Blockaden für KI-Crawler an. Die greifen noch vor der robots.txt, sind also in der Datei gar nicht sichtbar. Wenn deine robots.txt sauber aussieht und die Bots trotzdem nicht durchkommen, liegt es meist hier.
Das Tückische daran: Du merkst nichts. Keine Fehlermeldung, kein Ranking-Verlust, kein Hinweis in der Search Console. Du bist einfach in einer wachsenden Zahl von Antworten nicht vorhanden.
Kopierfertig: robots.txt für volle KI-Sichtbarkeit
Diese Variante gibt die Suchcrawler frei und lässt auch die Trainingscrawler zu.
# https://www.robotstxt.org/robotstxt.html
User-agent: *
Allow: /
# --- Suchcrawler: machen dich in KI-Antworten sichtbar ---
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
# --- Trainingscrawler: bewusste Entscheidung ---
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /
Sitemap: https://deine-domain.de/sitemap.xml
Willst du sichtbar sein, aber kein Trainingsmaterial liefern, ersetzt du im unteren Block Allow: / durch Disallow: /. Die Sichtbarkeit in den Suchfunktionen bleibt davon unberührt – das ist genau der Sinn der Trennung.
Ein Hinweis zum Aufräumen: Wenn in deiner robots.txt noch Crawl-delay: 1 steht, prüf, ob das noch nötig ist. Die Direktive bremst Crawler aus, wird von Googlebot ohnehin ignoriert und stammt meist aus einer Zeit, in der Server schwächer waren.
llms.txt: was sie ist und was sie nicht ist
Jetzt zum Thema, bei dem gerade am meisten übertrieben wird.
llms.txt ist eine Textdatei im Wurzelverzeichnis, die einem Sprachmodell in kompakter Form sagt, worum es auf der Website geht und welche Unterseiten die wichtigsten sind. Vorgeschlagen hat sie Jeremy Howard, erstmals veröffentlicht am 3. September 2024, eine zweite Fassung folgte im August 2026.
Der Aufbau ist schlicht: eine H1 mit dem Namen, ein Blockzitat mit einer kurzen Zusammenfassung, optional weitere Absätze, dann H2-Abschnitte mit Linklisten.
Und jetzt die Einordnung, die in Anbieter-Werbung meist fehlt: Es handelt sich um einen Vorschlag, nicht um einen verbindlichen Standard. Anders als bei robots.txt gibt es keine Zusage der KI-Anbieter, dass sie die Datei auswerten. Was stimmt: OpenAI, Anthropic und Google veröffentlichen für ihre eigenen Entwicklerdokumentationen selbst llms.txt-Dateien. Dass sie fremde lesen, folgt daraus nicht.
Ich empfehle sie trotzdem, aus einem nüchternen Grund: Der Aufwand liegt bei etwa einer Stunde, das Risiko bei null, und die Übung zwingt dich, dein Angebot in klare Sätze zu fassen. Wer dir dafür Ranking-Garantien verspricht, verkauft dir etwas.
Vorlage für ein Maklerbüro
# Mustermann Immobilien
> Mustermann Immobilien ist ein inhabergeführtes Maklerbüro in Braunschweig
> mit Schwerpunkt auf Wohnimmobilien im Raum Braunschweig, Wolfenbüttel und
> Peine. Leistungen: Verkauf, Vermietung, Immobilienbewertung.
Inhaber: Max Mustermann, Immobilienmakler nach § 34c GewO, IHK Braunschweig.
Adresse: Musterstraße 1, 38100 Braunschweig. Telefon: +49 531 1234567.
## Leistungen
- [Immobilienverkauf](https://deine-domain.de/verkaufen): Ablauf, Unterlagen, Vermarktung
- [Immobilienbewertung](https://deine-domain.de/bewertung): kostenlose Ersteinschätzung
- [Vermietung](https://deine-domain.de/vermieten): Mietersuche und Bonitätsprüfung
## Marktwissen
- [Marktbericht Braunschweig](https://deine-domain.de/marktbericht): Preise nach Stadtteil
- [Ratgeber Hausverkauf](https://deine-domain.de/ratgeber/hausverkauf): Ablauf und Fristen
## Rechtliches
- [Impressum](https://deine-domain.de/impressum)
- [Datenschutz](https://deine-domain.de/datenschutz)
Kurzfazit: robots.txt ist Pflicht und wirkt. llms.txt ist eine günstige Wette mit unklarer Auszahlung – machen, aber nichts darauf setzen.
Aus der Praxis
Klose & Partner war für Google praktisch unsichtbar, während die Wettbewerber in der Region gefunden wurden. Nach technischer Optimierung und ersten Inhalten standen binnen drei Wochen 539 Impressionen und 100 Besucher in der Search Console, bei 13,9 Prozent Klickrate.
Der Grund, warum dieser Fall auch hierhin gehört: Technische Sichtbarkeit ist Voraussetzung, nicht Zugabe. Eine Seite, die Crawler nicht erreichen, existiert für diese Systeme nicht – egal wie gut der Inhalt ist und wie sauber die strukturierten Daten gesetzt sind. Das gilt für Googlebot seit zwanzig Jahren und seit ein paar Jahren eben auch für eine neue Gruppe von Abrufern. Einzelfall, keine zugesicherte Eigenschaft.
Checkliste: Crawler-Steuerung in 30 Minuten
- robots.txt aufrufen unter deine-domain.de/robots.txt und lesen, was drinsteht.
- Auf pauschale Sperren prüfen.
Disallow: /unterUser-agent: *sperrt alles. - Sicherheits-Plugins durchsehen auf Optionen wie „Block AI Bots".
- CDN-Einstellungen prüfen, falls du eines nutzt – Blockaden dort greifen vor der robots.txt.
- Entscheiden: Sichtbarkeit ja, Training ja oder nein? Beides ist vertretbar, Nichtstun nicht.
- robots.txt anpassen nach der Vorlage oben.
- Prüfen, ob deine Datei tatsächlich ausgeliefert wird – manche Systeme generieren eine eigene, die deine überschreibt.
- Crawl-delay entfernen, falls vorhanden und nicht begründet.
- llms.txt anlegen nach der Vorlage. Eine Stunde, einmalig.
Häufige Fragen
Halten sich die Bots überhaupt an die robots.txt?
Die genannten Anbieter dokumentieren, dass ihre Crawler die Datei respektieren, und veröffentlichen zusätzlich ihre IP-Bereiche zur Verifikation. Eine technische Garantie ist es nicht – die robots.txt ist eine Anweisung, keine Sperre. Wer bestimmte Inhalte wirklich schützen muss, braucht eine Zugangsbeschränkung, keinen Eintrag in einer Textdatei.
Sollte ich GPTBot blockieren?
Das ist eine Geschäftsentscheidung, keine technische. Dagegen spricht: Deine öffentlichen Inhalte fließen möglicherweise in Modelltraining ein. Dafür spricht: Für ein lokales Maklerbüro ist der praktische Nachteil gering, während eine bekannte Marke im Modellwissen langfristig eher hilft. Wichtig ist nur, dass du dabei nicht versehentlich OAI-SearchBot mitsperrst.
Was ist der Unterschied zwischen robots.txt und llms.txt?
Die robots.txt regelt Zugriff – wer darf was abrufen. Die llms.txt beschreibt Inhalt – worum geht es hier und was ist wichtig. Die eine ist etabliert und wird respektiert, die andere ist ein Vorschlag ohne verbindliche Unterstützung. Sie ersetzen einander nicht.
Verliere ich Google-Rankings, wenn ich Google-Extended sperre?
Nein. Google schreibt dazu ausdrücklich, dass Google-Extended weder die Aufnahme in die Google-Suche noch das Ranking beeinflusst. Es steuert ausschließlich die Nutzung für Gemini-Training und Grounding.
Muss ich das für jede neue KI regelmäßig anpassen?
Ein- bis zweimal im Jahr draufschauen reicht. Neue Anbieter kommen dazu, Bezeichnungen ändern sich gelegentlich. Wenn deine allgemeine Regel User-agent: * auf Allow: / steht, sind neue Crawler ohnehin standardmäßig zugelassen – dann ist die Pflege nur für gezielte Ausnahmen nötig.
Nächster Schritt
Ruf jetzt deine robots.txt auf. Wie du danach prüfst, ob sich etwas bewegt, steht in der Anleitung zur Messung der KI-Sichtbarkeit. Wenn du dort nichts zu KI-Crawlern findest, ist das meist die bessere Nachricht als etwas zu finden – dann greift deine allgemeine Regel, und die steht in der Regel auf Erlauben.
Falls du unsicher bist, ob die Bots tatsächlich durchkommen: Wir prüfen das zusammen mit deinen strukturierten Daten und einem Nennungs-Test über alle relevanten Systeme. Kostenlos und unverbindlich: GEO für Immobilienmakler.
Bereit für Ihre eigene KI-Lösung?
Lassen Sie uns gemeinsam besprechen, wie wir Ihr Immobiliengeschäft mit KI auf das nächste Level bringen können.
Kostenlose Beratung