Ihre robots.txt regelt seit Jahren, welche Suchmaschinen-Crawler auf Ihre Website zugreifen dürfen. Doch neben Googlebot gibt es inzwischen KI-Crawler und Search-Bots, die öffentliche Inhalte technisch abrufen können. Wer diese Crawler nicht kennt, verliert Transparenz über die technische Zugänglichkeit seiner Inhalte. Dieser Guide zeigt, welche KI-Crawler es gibt, wie Sie sie konfigurieren und wo llms.txt nur ergänzt.
GPTBot ist ein Crawler von OpenAI. OAI-SearchBot und ChatGPT-User haben andere Aufgaben und sollten nicht mit GPTBot vermischt werden. ClaudeBot gehört zu Anthropic, PerplexityBot durchsucht das Web für Perplexity AI, Google-Extended ist ein Google-Produkt-Token zur Steuerung bestimmter KI-Nutzungen gecrawlter Inhalte - getrennt vom normalen Googlebot. Jeder dieser Crawler hat einen eigenen User-Agent-String und kann separat in Ihrer robots.txt behandelt werden. Diese Entscheidung beeinflusst technische Zugänglichkeit; Zitationen oder Erwähnungen bleiben Anbieterentscheidung.
Direkt testen
Prüfen Sie Ihren GEO Score in 60 Sekunden - kostenlos, ohne Account. 42 Faktoren analysiert.
Die Konfiguration folgt dem gleichen Muster wie für Googlebot. Mit „User-agent: GPTBot“ und „Allow: /“ erlauben Sie OpenAI den technischen Zugriff. Mit „Disallow: /intern/“ sperren Sie einzelne Verzeichnisse. Für maschinenlesbare Auffindbarkeit empfehlen wir: öffentliche Produkt-, Service- und Informationsseiten nicht versehentlich blockieren, sensible Bereiche wie Admin-Panels oder interne Dokumente aber konsequent sperren. Wichtig: robots.txt steuert Zugriff, nicht Erwähnungen, Zitationen oder Empfehlungen.
Neben robots.txt gibt es llms.txt als junge, nicht universell akzeptierte Zusatzdatei. Diese Datei liegt im Root-Verzeichnis Ihrer Website und liefert eine kompakte Zusammenfassung Ihres Unternehmens: Wer sind Sie? Was bieten Sie an? Was sind Ihre Kernprodukte? Systeme, die llms.txt auswerten, erhalten dadurch einen strukturierten Einstieg. Beconova generiert Ihre llms.txt automatisch aus Ihren Produktdaten und Schema.org-Informationen. Das ist eine sinnvolle Discovery-Schicht, aber kein Ranking- oder Empfehlungsversprechen.
Der häufigste Fehler ist, alle OpenAI-Bots gleichzusetzen. OpenAI dokumentiert getrennte User-Agents: GPTBot sammelt öffentliche Inhalte, die für das Training von Modellen verwendet werden können. OAI-SearchBot erfasst Seiten, damit sie in den Suchfunktionen von ChatGPT als Quelle erscheinen können. ChatGPT-User ruft Seiten ab, wenn eine Person in ChatGPT konkret nach einer URL oder einer Live-Information fragt. Das bedeutet in der Praxis: Wer GPTBot sperrt, schließt seine Inhalte vom Training aus, bleibt aber über OAI-SearchBot für die ChatGPT-Suche erreichbar - sofern dieser nicht ebenfalls gesperrt ist. Ähnlich trennen andere Anbieter: Anthropic nutzt ClaudeBot sowie eigene Agents für Suche und nutzerinitiierte Abrufe, Perplexity unterscheidet PerplexityBot und Perplexity-User. Google-Extended ist kein eigener Crawler, sondern ein Steuerungs-Token: Es regelt bestimmte Nutzungen für Gemini-Modelle, hat aber laut Google keinen Einfluss darauf, ob Ihre Seite in der Google-Suche erscheint. Prüfen Sie die aktuellen Bezeichnungen immer in der offiziellen Dokumentation des jeweiligen Anbieters, da sich User-Agents ändern können.
Eine verbreitete Konfiguration für Unternehmen, die in KI-Suchen auffindbar sein wollen: ein Block "User-agent: OAI-SearchBot" mit "Allow: /", ein Block "User-agent: PerplexityBot" mit "Allow: /" und ein Block "User-agent: GPTBot" mit "Allow: /" oder "Disallow: /" - je nachdem, ob Sie Trainingsnutzung zulassen möchten. Bereiche wie /admin/, /checkout/ oder /konto/ sperren Sie für alle in einem gemeinsamen Block "User-agent: *". Drei Regeln helfen gegen typische Fehler: Erstens befolgt jeder Bot nur den spezifischsten passenden Block - ein Bot mit eigenem Block ignoriert die Regeln unter "User-agent: *". Zweitens sperrt ein einzelnes "Disallow: /" die gesamte Website. Drittens muss die Datei exakt unter /robots.txt im Root der Domain liegen und mit Status 200 ausgeliefert werden. Verweisen Sie zusätzlich mit "Sitemap: https://ihre-domain.de/sitemap.xml" auf Ihre Sitemap.
Viele Websites erlauben KI-Crawler in der robots.txt und blockieren sie trotzdem. Der häufigste Grund sind Bot-Schutz-Einstellungen bei CDN- oder Hosting-Anbietern: Firewalls, Bot-Abwehr-Modi oder Regeln gegen KI-Crawler liefern Fehlerseiten oder Challenges aus, bevor die robots.txt überhaupt eine Rolle spielt. Ein zweiter Grund sind Inhalte, die nur per JavaScript geladen werden: Nicht jeder Crawler rendert JavaScript vollständig, wichtige Fakten sollten deshalb im HTML stehen. Drittens stehen Preise, Leistungen oder Kontaktdaten oft nur in Bildern oder PDFs - Text im HTML ist für Maschinen deutlich zuverlässiger auslesbar. Prüfen Sie deshalb nicht nur die Datei, sondern die tatsächliche Antwort Ihres Servers: Statuscode, ausgelieferter Inhalt und Ladezeit.
User-Agent-Strings lassen sich leicht fälschen. Ein Besuch mit "GPTBot" im User-Agent beweist daher noch nicht, dass tatsächlich OpenAI angefragt hat. Mehrere Anbieter veröffentlichen die IP-Bereiche ihrer Crawler; OpenAI stellt dafür JSON-Listen bereit. Gleichen Sie die IP-Adressen in Ihren Server-Logs mit diesen Listen ab, um echte von gefälschten Zugriffen zu trennen. Für einen schnellen Selbsttest zeigt der Robots.txt AI-Crawler Checker von Beconova, welche bekannten KI-User-Agents Ihre robots.txt erlaubt oder sperrt. Für eine laufende Erkennung echter KI-Besuche bietet Beconova das KI-Besucher-Tracking.
robots.txt und llms.txt sind technische Grundlagen für KI-lesbare Inhalte. Wer beide Dateien korrekt konfiguriert, verbessert Zugänglichkeit und maschinenlesbare Orientierung. Ob Inhalte zitiert oder erwähnt werden, entscheidet der jeweilige Anbieter. Beconova hilft Ihnen dabei - von der automatischen llms.txt-Generierung bis zum Integrations-Guide.
GEO Score kostenlos prüfenMarvin Malessa
Gründer, Beconova
Gründete Beconova 2025 in Deutschland, um Shops und Dienstleistern den Weg in KI-Suchmaschinen zu öffnen. Schreibt über GEO, KI-Sichtbarkeit und die Zukunft der Suche.
Starten Sie mit Beconova und werden Ihre Daten für ChatGPT, Perplexity und Claude messbar auswertbar.
Jetzt starten