Was ist GPTBot – und sollten Sie KI-Crawler auf Ihre Website lassen?
Sergey Carp aus Ormoc, Mitgründer / CTO
GPTBot ist der Webcrawler von OpenAI, dem Unternehmen hinter ChatGPT. Er besucht Websites und sammelt Inhalte, die zum Training der Modelle von OpenAI verwendet werden können. Er meldet sich mit dem User-Agent GPTBot – unter diesem Namen erlauben oder sperren Sie ihn in der robots.txt, und unter diesem Namen sehen Sie ihn in Ihren Server-Logs.
Das Wichtigste in Kürze
GPTBot ist der Trainings-Crawler von OpenAI, getrennt von OAI-SearchBot und ChatGPT-User. Such-Bots zulassen, eine Regel für Trainings-Bots festlegen und das CDN prüfen.
OpenAI hat drei Bots, nicht einen
- GPTBot sammelt Inhalte für das Modelltraining;
- OAI-SearchBot findet Seiten für die Suchergebnisse in ChatGPT;
- ChatGPT-User öffnet eine Seite, wenn ein Nutzer ChatGPT bittet, sie sich anzusehen.
Eine Sperre von GPTBot entfernt Sie nicht aus der ChatGPT-Suche, und eine Freigabe bringt Sie nicht hinein. Jeder Bot wird separat gesteuert.
Weitere KI-Crawler
- Google: Google-Extended steuert, ob Ihr Content für Training und Grounding von Gemini genutzt wird; auf die Google-Suche wirkt es sich nicht aus.
- Anthropic: ClaudeBot, Claude-SearchBot und Claude-User.
- Perplexity: PerplexityBot und Perplexity-User.
- Microsoft: Copilot stützt sich auf Bingbot.
Wenn Sie Ihren Content zum Beispiel aus dem Training von OpenAI heraushalten, aber in der ChatGPT-Suche sichtbar bleiben möchten, könnte Ihre robots.txt Folgendes enthalten:
User-agent: GPTBot Disallow: / User-agent: OAI-SearchBot Allow: /
Sollten Sie KI-Crawler auf Ihre Website lassen?
- Such- und Antwort-Bots sollten Sie auf einer Unternehmenswebsite in der Regel zulassen. Sonst können KI-Assistenten Ihre Seiten weder zitieren noch verlinken.
- Trainings-Bots können Sie je nach Unternehmensrichtlinie zulassen oder einschränken.
- Geschützte Bereiche wie Kontoseiten, Warenkorb und Adminbereich sollten für alle Bots gesperrt sein.
Hören Sie nicht bei der robots.txt auf. Hosting-Firewalls und der Bot-Schutz von CDNs sperren KI-Crawler manchmal, ohne dass der Website-Betreiber davon weiß. Die Server-Logs zeigen, ob diese Bots tatsächlich durchkommen. Eine vollständige Übersicht finden Sie im Artikel Welche KI-Crawler Sie zulassen und welche Sie sperren sollten.
Bei KI-Suchmaschinenoptimierung gehört die Konfiguration des Zugriffs für KI-Crawler zur technischen Optimierung. Vereinbaren Sie ein Gespräch, und wir prüfen, welche Bots Ihre Website gerade abweist.