Gerador de robots.txt — com presets de rastreadores de IA (GPTBot)
DesenvolvimentoUm gerador de robots.txt combina uma política de rastreamento, caminhos Disallow, a localização do sitemap e as opções de permitir ou bloquear rastreadores de IA em um arquivo robots.txt pronto para a raiz do seu site.
Esta página foi traduzida com ajuda de IA e ainda não recebeu revisão profissional. Consulte as fontes citadas antes de usá-la em uma decisão importante.
O que é
robots.txt é um arquivo de texto simples na raiz do site (/robots.txt) que declara as regras Allow e Disallow por rastreador (User-agent) junto com a localização do sitemap, seguindo o Protocolo de Exclusão de Robôs RFC 9309. Esta ferramenta monta o arquivo a partir de uma política base e caminhos bloqueados, e adiciona presets para rastreadores de IA conhecidos como GPTBot, ClaudeBot, PerplexityBot e CCBot. Como o cumprimento é voluntário, o robots.txt não é um mecanismo de segurança.
Como usar
- 1Escolha a política base (permitir tudo ou bloquear tudo) e liste os caminhos a bloquear.
- 2Selecione o preset de rastreadores de IA e adicione a URL do seu sitemap.
- 3Baixe o robots.txt gerado e envie-o para a raiz do site (/robots.txt).
Referência
| Rastreador | Operador | Finalidade |
|---|---|---|
| GPTBot | OpenAI | rastreamento para treinar modelos de IA |
| ChatGPT-User | OpenAI | downloads ao vivo para usuários do ChatGPT |
| OAI-SearchBot | OpenAI | índice de busca do ChatGPT |
| ClaudeBot | Anthropic | rastreamento para treinar modelos de IA |
| Google-Extended | token de controle de treinamento do Gemini | |
| PerplexityBot | Perplexity | índice de busca de IA |
| CCBot | Common Crawl | arquivo web aberto (reutilizado para treinar IA) |
| Bytespider | ByteDance | rastreamento para treinar IA |
| Applebot-Extended | Apple | token de controle de treinamento de IA da Apple |
Fontes e padrões
- RFC 9309: Robots Exclusion Protocol - IETF
- Introduction to robots.txt - Google Search Central
- OpenAI crawlers and bots - OpenAI
Perguntas frequentes
Minhas regras são enviadas a um servidor?
Não. O robots.txt é gerado inteiramente no seu navegador; nada é enviado.
Bloquear rastreadores de IA no robots.txt os detém por completo?
Não. O robots.txt depende do cumprimento voluntário (RFC 9309). Os principais rastreadores de IA como o GPTBot afirmam respeitá-lo, mas os bots que ignoram as regras só podem ser detidos no nível do servidor ou do firewall.
O Disallow remove as páginas dos resultados de busca?
Não. O Disallow apenas impede o rastreamento; as URLs já conhecidas ainda podem ser indexadas. Use uma meta tag noindex quando o objetivo for removê-las dos resultados de busca.