Générateur de robots.txt — avec presets de robots d'IA (GPTBot)
DéveloppementUn générateur de robots.txt combine une politique d'exploration, des chemins Disallow, l'emplacement du sitemap et les choix d'autorisation ou de blocage des robots d'IA dans un fichier robots.txt prêt pour la racine de votre site.
Cette page a été traduite avec l’aide de l’IA et n’a pas encore été relue par un professionnel. Consultez les sources citées avant toute décision importante.
Qu’est-ce que c’est
robots.txt est un fichier texte brut placé à la racine du site (/robots.txt) qui déclare les règles Allow et Disallow par robot (User-agent) ainsi que l'emplacement du sitemap, conformément au protocole d'exclusion des robots RFC 9309. Cet outil construit le fichier à partir d'une politique de base et de chemins bloqués, et ajoute des presets pour des robots d'IA connus comme GPTBot, ClaudeBot, PerplexityBot et CCBot. Comme le respect est volontaire, robots.txt n'est pas un mécanisme de sécurité.
Comment l’utiliser
- 1Choisissez la politique de base (tout autoriser ou tout bloquer) et listez les chemins à bloquer.
- 2Sélectionnez le preset de robots d'IA et ajoutez l'URL de votre sitemap.
- 3Téléchargez le robots.txt généré et déposez-le à la racine du site (/robots.txt).
Référence
| Robot | Opérateur | Finalité |
|---|---|---|
| GPTBot | OpenAI | exploration pour l'entraînement de modèles d'IA |
| ChatGPT-User | OpenAI | récupérations en direct pour les utilisateurs de ChatGPT |
| OAI-SearchBot | OpenAI | index de recherche de ChatGPT |
| ClaudeBot | Anthropic | exploration pour l'entraînement de modèles d'IA |
| Google-Extended | jeton de contrôle de l'entraînement de Gemini | |
| PerplexityBot | Perplexity | index de recherche d'IA |
| CCBot | Common Crawl | archive web ouverte (réutilisée pour l'entraînement d'IA) |
| Bytespider | ByteDance | exploration pour l'entraînement d'IA |
| Applebot-Extended | Apple | jeton de contrôle de l'entraînement d'IA d'Apple |
Sources et normes
- RFC 9309: Robots Exclusion Protocol - IETF
- Introduction to robots.txt - Google Search Central
- OpenAI crawlers and bots - OpenAI
FAQ
Mes règles sont-elles envoyées à un serveur ?
Non. Le robots.txt est généré entièrement dans votre navigateur ; rien n'est envoyé.
Bloquer les robots d'IA dans robots.txt les arrête-t-il complètement ?
Non. robots.txt repose sur le respect volontaire (RFC 9309). Les principaux robots d'IA comme GPTBot déclarent le respecter, mais les robots qui ignorent les règles ne peuvent être arrêtés qu'au niveau du serveur ou du pare-feu.
Disallow retire-t-il les pages des résultats de recherche ?
Non. Disallow empêche seulement l'exploration ; les URL déjà connues peuvent encore être indexées. Utilisez une balise meta noindex lorsque l'objectif est de les retirer des résultats de recherche.