Liest ChatGPT meine Website überhaupt?
Nur, wenn weder Ihre robots.txt noch Ihr Hoster den Crawler aussperrt. OpenAI nutzt nach eigenen Angaben den Crawler OAI-SearchBot, um Websites in den Suchantworten von ChatGPT anzuzeigen. Seiten, die OAI-SearchBot ausschließen, erscheinen laut OpenAI nicht in den Suchantworten.
Die robots.txt ist eine einfache Textdatei im Hauptverzeichnis Ihrer Website, erreichbar unter ihre-kanzlei.de/robots.txt. Sie sagt Crawlern, welche Bereiche sie abrufen dürfen. Viele Kanzleiwebsites haben eine robots.txt, die der Webdienstleister einmal angelegt und nie wieder angesehen hat. Ein Blick hinein dauert eine Minute.
Welche KI-Crawler gibt es, und wofür sind sie da?
Die wichtigsten Anbieter trennen zwischen Crawlern für die Suche, für das Training und für Abrufe, die ein Nutzer auslöst. Die folgende Übersicht beruht auf den offiziellen Dokumentationen der Anbieter, Stand September 2026.
| Name im robots.txt | Anbieter | Zweck laut Anbieter | Beachtet robots.txt? |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Anzeige von Websites in der ChatGPT-Suche | ja |
| GPTBot | OpenAI | Training von KI-Modellen | ja |
| ChatGPT-User | OpenAI | Abruf einer Seite, wenn ein Nutzer in ChatGPT fragt | laut OpenAI gelten die Regeln möglicherweise nicht |
| Claude-SearchBot | Anthropic | Verbesserung der Suchergebnisse in Claude | ja |
| ClaudeBot | Anthropic | Sammlung von Inhalten für das Training | ja |
| Claude-User | Anthropic | Abruf, wenn ein Nutzer in Claude fragt | ja, laut Anthropic steuerbar |
| PerplexityBot | Perplexity | Anzeige und Verlinkung in Perplexity-Suchergebnissen, nicht für Training | ja |
| Perplexity-User | Perplexity | Abruf, wenn ein Nutzer in Perplexity fragt | laut Perplexity in der Regel nicht |
| Google-Extended | kein eigener Crawler; steuert Nutzung für Gemini-Training und Gemini-Apps | ja (als Steuerungszeichen) | |
| Applebot-Extended | Apple | kein eigener Crawler; steuert Nutzung für das Training von Apple-Modellen | ja (als Steuerungszeichen) |
| Bingbot | Microsoft | Bing-Suchindex, Grundlage für Microsoft Copilot | ja |
Quellen: OpenAI, Anthropic, Perplexity, Google, Apple, Microsoft Bing.
Wie sieht eine robots.txt aus, die KI-Suche zulässt?
Am einfachsten: Sie erlauben allen Crawlern alles, was öffentlich sein soll. Eine robots.txt, die nichts sperrt, lässt auch alle KI-Crawler zu:
User-agent: *
Allow: /
Sitemap: https://www.ihre-kanzlei.de/sitemap.xml
Gesperrt werden sollten nur Bereiche, die ohnehin nicht öffentlich sind, etwa ein Login-Bereich. Die robots.txt ist dabei kein Schutz: Sie ist ein Hinweis an Crawler, keine Zugangssperre. Vertrauliches gehört hinter ein Passwort, nicht in eine robots.txt.
Kann ich die KI-Suche erlauben und das Training verbieten?
Ja, bei OpenAI, Anthropic, Google und Apple über getrennte Namen. Wer nicht möchte, dass seine Texte in das Training von KI-Modellen einfließen, aber in KI-Suchen erscheinen will, kann das so festlegen:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: *
Allow: /
Sitemap: https://www.ihre-kanzlei.de/sitemap.xml
OAI-SearchBot, Claude-SearchBot, PerplexityBot und Bingbot fallen hier unter den allgemeinen Abschnitt und bleiben zugelassen.
Zwei Hinweise dazu. Erstens: Google-Extended steuert laut Google nicht nur das Training, sondern auch die Fundierung von Antworten in Gemini-Apps. Wer in Gemini sichtbar sein will, sollte Google-Extended deshalb nicht pauschal sperren. Zweitens: Legen Sie einen eigenen Abschnitt für Bingbot an, beachtet Bingbot laut Microsoft nur noch diesen und ignoriert den allgemeinen Abschnitt. Allgemeine Regeln müssen dann dort wiederholt werden.
Ob Sie das Training zulassen, ist eine Abwägung. Für die Nennung in KI-Suchen ist vor allem die Lesbarkeit durch die Such-Crawler entscheidend.
Blockiert meine Website KI-Crawler, ohne dass ich es weiß?
Das kommt vor, weil Hoster, CDN oder Sicherheits-Plugins eigene Sperren setzen. Manche Anbieter von Bot-Schutz und CDN blockieren KI-Crawler inzwischen standardmäßig oder bieten eine Sperre per Schalter an. Die robots.txt sieht dann harmlos aus, die Crawler werden trotzdem abgewiesen.
Checkliste:
- robots.txt aufrufen und nach
Disallow: /bei den oben genannten Namen suchen. - Einstellungen des CDN oder der Web Application Firewall auf „KI-Bots blockieren“ oder ähnliche Optionen prüfen.
- Sicherheits-Plugins des Content-Management-Systems auf Bot-Sperren prüfen.
- Nachfragen, ob der Hoster KI-Crawler serverseitig filtert.
- Meta-Angaben wie
noindexodernosnippetauf wichtigen Seiten ausschließen. - Prüfen, ob wichtige Texte ohne JavaScript sichtbar sind. Viele Crawler führen kein JavaScript aus.
Warum hilft robots.txt nicht gegen jeden Abruf?
Weil einige Abrufe von Nutzern ausgelöst werden und die Anbieter sie anders behandeln. OpenAI schreibt zu ChatGPT-User, dass die robots.txt-Regeln bei nutzergesteuerten Abrufen möglicherweise nicht gelten. Perplexity gibt für Perplexity-User an, robots.txt in der Regel nicht zu beachten. Anthropic dagegen nennt Claude-User als über die robots.txt steuerbar.
Für Kanzleien ist das selten ein Problem. Öffentliche Seiten sollen ja gelesen werden. Wer Inhalte wirklich schützen muss, braucht eine Anmeldung, keine robots.txt.
Wie prüfe ich, ob KI-Crawler meine Seite abrufen?
In den Server-Logs Ihrer Website. Jeder Abruf wird dort mit einer Kennung (User-Agent) gespeichert. Suchen Sie nach den Namen aus der Tabelle, etwa „OAI-SearchBot“ oder „Claude-SearchBot“.
Beachten Sie: Die Kennung kann gefälscht werden. OpenAI veröffentlicht nach eigenen Angaben die IP-Adressbereiche seiner Crawler, sodass sich Abrufe überprüfen lassen. Fragen Sie Ihren Hoster, ob Sie Zugriff auf die Logs haben. Bei vielen einfachen Hosting-Paketen ist das in den Einstellungen möglich.
Was ist mit Inhalten, die per JavaScript nachgeladen werden?
Sie bleiben für viele Crawler unsichtbar. Manche Websites laden Texte erst im Browser per JavaScript nach, etwa bei bestimmten Baukastensystemen oder Single-Page-Anwendungen. Crawler, die kein JavaScript ausführen, sehen dann nur eine leere Seite.
Prüfen Sie das so: Öffnen Sie eine Seite Ihrer Website, lassen Sie sich den Quelltext anzeigen (in den meisten Browsern mit Strg+U bzw. Cmd+Option+U) und suchen Sie nach einem Satz aus dem sichtbaren Text. Steht er im Quelltext, ist er für Crawler lesbar. Fehlt er, sollten Sie mit Ihrem Webdienstleister über serverseitige Auslieferung sprechen. Dasselbe gilt für Texte, die nur in Bildern oder PDFs stehen.
Brauche ich zusätzlich eine llms.txt?
Sie schadet nicht, ist aber kein Ersatz für eine lesbare Website. Die llms.txt ist ein Vorschlag von Jeremy Howard aus dem Jahr 2024, kein offizieller Standard. Sie fasst in einer Textdatei zusammen, was eine Website bietet, und verlinkt die wichtigsten Seiten.
Ob und wie stark einzelne KI-Anbieter sie auswerten, ist derzeit offen. Wichtiger bleiben die Punkte oben und eine Website, die typische Mandantenfragen klar beantwortet. Mehr dazu im Leitfaden In ChatGPT gefunden werden.
Wie melde ich meine Website bei Bing an?
Über die Bing Webmaster Tools, kostenlos. Weil Microsoft Copilot auf Bing zugreift, lohnt sich die Anmeldung auch für die KI-Sichtbarkeit.
- Konto bei den Bing Webmaster Tools anlegen.
- Website bestätigen, etwa über einen DNS-Eintrag oder durch Import aus der Google Search Console.
- Sitemap einreichen.
- Den robots.txt-Tester nutzen, um zu prüfen, ob Bingbot Ihre Seiten abrufen darf.
Optional können Sie Änderungen über das Protokoll IndexNow melden, das Bing unterstützt. Viele Content-Management-Systeme bieten dafür Erweiterungen an.
Dieser Ratgeber beschreibt technische Grundlagen. Er ist keine Rechtsberatung. Crawler-Namen und Regeln der Anbieter ändern sich; die Angaben entsprechen den offiziellen Dokumentationen im September 2026 und werden halbjährlich geprüft. Zulassen allein führt nicht zu einer Nennung in KI-Antworten.
Weiter: Wie wir robots.txt, Bot-Schutz und Inhalte Ihrer Website für Google und KI-Systeme prüfen, lesen Sie unter KI-Sichtbarkeit.
Quellen: OpenAI: Overview of OpenAI Crawlers · Anthropic: Crawler von Anthropic · Perplexity: Perplexity Crawlers · Google: Common crawlers / Google-Extended · Apple: About Applebot · Microsoft Bing: Which crawlers does Bing use? · llmstxt.org (alle abgerufen im September 2026)
Dieser Ratgeber beschreibt technische und organisatorische Grundlagen. Er ist keine Rechtsberatung. Funktionen der genannten Produkte ändern sich häufig; wir prüfen die Angaben halbjährlich.
