Generador de robots.txt — con presets de rastreadores de IA (GPTBot)
DesarrolloUn generador de robots.txt combina una política de rastreo, rutas Disallow, la ubicación del sitemap y las opciones de permitir o bloquear rastreadores de IA en un archivo robots.txt listo para la raíz de tu sitio.
Esta página se tradujo con ayuda de IA y aún no ha recibido revisión profesional. Consulta las fuentes citadas antes de usarla para una decisión importante.
Qué es
robots.txt es un archivo de texto plano en la raíz del sitio (/robots.txt) que declara las reglas Allow y Disallow por rastreador (User-agent) junto con la ubicación del sitemap, siguiendo el Protocolo de Exclusión de Robots RFC 9309. Esta herramienta construye el archivo a partir de una política base y rutas bloqueadas, y añade presets para rastreadores de IA conocidos como GPTBot, ClaudeBot, PerplexityBot y CCBot. Como el cumplimiento es voluntario, robots.txt no es un mecanismo de seguridad.
Cómo se usa
- 1Elige la política base (permitir todo o bloquear todo) y enumera las rutas a bloquear.
- 2Selecciona el preset de rastreadores de IA y añade la URL de tu sitemap.
- 3Descarga el robots.txt generado y súbelo a la raíz del sitio (/robots.txt).
Referencia
| Rastreador | Operador | Finalidad |
|---|---|---|
| GPTBot | OpenAI | rastreo para entrenar modelos de IA |
| ChatGPT-User | OpenAI | descargas en vivo para usuarios de ChatGPT |
| OAI-SearchBot | OpenAI | índice de búsqueda de ChatGPT |
| ClaudeBot | Anthropic | rastreo para entrenar modelos de IA |
| Google-Extended | token de control de entrenamiento de Gemini | |
| PerplexityBot | Perplexity | índice de búsqueda de IA |
| CCBot | Common Crawl | archivo web abierto (reutilizado para entrenar IA) |
| Bytespider | ByteDance | rastreo para entrenar IA |
| Applebot-Extended | Apple | token de control de entrenamiento de IA de Apple |
Fuentes y estándares
- RFC 9309: Robots Exclusion Protocol - IETF
- Introduction to robots.txt - Google Search Central
- OpenAI crawlers and bots - OpenAI
Preguntas frecuentes
¿Se envían mis reglas a un servidor?
No. El robots.txt se genera por completo en tu navegador; no se sube nada.
¿Bloquear rastreadores de IA en robots.txt los detiene por completo?
No. robots.txt depende del cumplimiento voluntario (RFC 9309). Los principales rastreadores de IA como GPTBot afirman respetarlo, pero los bots que ignoran las reglas solo pueden detenerse a nivel de servidor o cortafuegos.
¿Disallow retira las páginas de los resultados de búsqueda?
No. Disallow solo impide el rastreo; las URL ya conocidas aún pueden indexarse. Usa una meta etiqueta noindex cuando el objetivo sea retirarlas de los resultados de búsqueda.