robots.txt-Generator — mit Presets für KI-Crawler (GPTBot)
EntwicklungEin robots.txt-Generator kombiniert eine Crawling-Richtlinie, Disallow-Pfade, den Speicherort des Sitemaps und die Auswahl zum Zulassen oder Blockieren von KI-Crawlern zu einer robots.txt-Datei, die bereit für das Stammverzeichnis deiner Website ist.
Diese Seite wurde mit KI-Unterstützung übersetzt und noch nicht professionell geprüft. Prüfen Sie die zitierten Quellen vor einer wichtigen Entscheidung.
Was ist das
robots.txt ist eine reine Textdatei im Stammverzeichnis der Website (/robots.txt), die gemäß dem Robots-Exclusion-Protokoll RFC 9309 die Allow- und Disallow-Regeln pro Crawler (User-agent) sowie den Speicherort des Sitemaps deklariert. Dieses Tool erstellt die Datei aus einer Basisrichtlinie und blockierten Pfaden und fügt Presets für bekannte KI-Crawler wie GPTBot, ClaudeBot, PerplexityBot und CCBot hinzu. Da die Einhaltung freiwillig ist, ist robots.txt kein Sicherheitsmechanismus.
Verwendung
- 1Wähle die Basisrichtlinie (alles zulassen oder alles blockieren) und liste die zu blockierenden Pfade auf.
- 2Wähle das Preset für KI-Crawler und füge die URL deines Sitemaps hinzu.
- 3Lade die erzeugte robots.txt herunter und lade sie in das Stammverzeichnis der Website hoch (/robots.txt).
Referenz
| Crawler | Betreiber | Zweck |
|---|---|---|
| GPTBot | OpenAI | Crawling zum Training von KI-Modellen |
| ChatGPT-User | OpenAI | Live-Abrufe für ChatGPT-Nutzer |
| OAI-SearchBot | OpenAI | Suchindex von ChatGPT |
| ClaudeBot | Anthropic | Crawling zum Training von KI-Modellen |
| Google-Extended | Steuerungs-Token für das Gemini-Training | |
| PerplexityBot | Perplexity | KI-Suchindex |
| CCBot | Common Crawl | offenes Web-Archiv (für KI-Training wiederverwendet) |
| Bytespider | ByteDance | Crawling für KI-Training |
| Applebot-Extended | Apple | Steuerungs-Token für Apples KI-Training |
Quellen und Normen
- RFC 9309: Robots Exclusion Protocol - IETF
- Introduction to robots.txt - Google Search Central
- OpenAI crawlers and bots - OpenAI
FAQ
Werden meine Regeln an einen Server gesendet?
Nein. Die robots.txt wird vollständig in deinem Browser erzeugt; nichts wird hochgeladen.
Stoppt das Blockieren von KI-Crawlern in der robots.txt sie vollständig?
Nein. robots.txt beruht auf freiwilliger Einhaltung (RFC 9309). Große KI-Crawler wie GPTBot geben an, sie zu befolgen, aber Bots, die die Regeln ignorieren, lassen sich nur auf Server- oder Firewall-Ebene stoppen.
Entfernt Disallow Seiten aus den Suchergebnissen?
Nein. Disallow verhindert nur das Crawling; bereits bekannte URLs können weiterhin indexiert werden. Verwende ein noindex-Meta-Tag, wenn das Ziel die Entfernung aus den Suchergebnissen ist.