Generator robots.txt — dengan Preset Crawler AI (GPTBot)
PengembangGenerator robots.txt menggabungkan kebijakan perayapan, jalur Disallow, lokasi sitemap, dan pilihan izinkan/blokir crawler AI menjadi berkas robots.txt yang siap untuk root situs Anda.
Halaman ini diterjemahkan dengan bantuan AI dan belum ditinjau secara profesional. Periksa sumber yang dikutip sebelum menggunakannya untuk keputusan penting.
Apa itu
robots.txt adalah berkas teks biasa di root situs (/robots.txt) yang mendeklarasikan aturan Allow dan Disallow per crawler (User-agent) beserta lokasi sitemap, mengikuti Protokol Pengecualian Robot RFC 9309. Alat ini menyusun berkas dari kebijakan dasar dan jalur yang diblokir, serta menambahkan preset untuk crawler AI terkenal seperti GPTBot, ClaudeBot, PerplexityBot, dan CCBot. Karena kepatuhannya bersifat sukarela, robots.txt bukan mekanisme keamanan.
Cara menggunakan
- 1Pilih kebijakan dasar (izinkan semua atau blokir semua) dan cantumkan jalur yang akan diblokir.
- 2Pilih preset crawler AI dan tambahkan URL sitemap Anda.
- 3Unduh robots.txt yang dihasilkan dan unggah ke root situs (/robots.txt).
Referensi
| Crawler | Operator | Tujuan |
|---|---|---|
| GPTBot | OpenAI | perayapan untuk melatih model AI |
| ChatGPT-User | OpenAI | pengambilan langsung untuk pengguna ChatGPT |
| OAI-SearchBot | OpenAI | indeks pencarian ChatGPT |
| ClaudeBot | Anthropic | perayapan untuk melatih model AI |
| Google-Extended | token kontrol pelatihan Gemini | |
| PerplexityBot | Perplexity | indeks pencarian AI |
| CCBot | Common Crawl | arsip web terbuka (dipakai ulang untuk pelatihan AI) |
| Bytespider | ByteDance | perayapan untuk pelatihan AI |
| Applebot-Extended | Apple | token kontrol pelatihan AI Apple |
Sumber & standar
- RFC 9309: Robots Exclusion Protocol - IETF
- Introduction to robots.txt - Google Search Central
- OpenAI crawlers and bots - OpenAI
FAQ
Apakah aturan saya dikirim ke server?
Tidak. robots.txt dihasilkan sepenuhnya di browser Anda; tidak ada yang diunggah.
Apakah memblokir crawler AI di robots.txt menghentikannya sepenuhnya?
Tidak. robots.txt bergantung pada kepatuhan sukarela (RFC 9309). Crawler AI utama seperti GPTBot menyatakan menghormatinya, tetapi bot yang mengabaikan aturan hanya dapat dihentikan pada tingkat server atau firewall.
Apakah Disallow menghapus halaman dari hasil pencarian?
Tidak. Disallow hanya mencegah perayapan; URL yang sudah dikenal masih dapat diindeks. Gunakan meta tag noindex jika tujuannya menghapus dari hasil pencarian.