Trình tạo robots.txt — kèm preset chặn crawler AI (GPTBot)
Lập trìnhTrình tạo robots.txt kết hợp chính sách thu thập dữ liệu, các đường dẫn Disallow, vị trí sitemap và lựa chọn cho phép/chặn crawler AI thành một tệp robots.txt sẵn sàng cho thư mục gốc của trang web của bạn.
Trang này được dịch với sự hỗ trợ của AI và chưa được chuyên gia rà soát. Hãy kiểm tra các nguồn trích dẫn trước khi dùng cho quyết định quan trọng.
Giới thiệu
robots.txt là một tệp văn bản thuần ở thư mục gốc của trang web (/robots.txt), khai báo các quy tắc Allow và Disallow theo từng crawler (User-agent) cùng vị trí sitemap, tuân theo Giao thức Loại trừ Robot RFC 9309. Công cụ này dựng tệp từ chính sách cơ sở và các đường dẫn bị chặn, đồng thời thêm preset cho các crawler AI nổi tiếng như GPTBot, ClaudeBot, PerplexityBot và CCBot. Vì việc tuân thủ là tự nguyện nên robots.txt không phải là một cơ chế bảo mật.
Cách dùng
- 1Chọn chính sách cơ sở (cho phép tất cả hoặc chặn tất cả) và liệt kê các đường dẫn cần chặn.
- 2Chọn preset crawler AI và thêm URL sitemap của bạn.
- 3Tải xuống robots.txt đã tạo và tải lên thư mục gốc của trang web (/robots.txt).
Tham khảo
| Crawler | Nhà vận hành | Mục đích |
|---|---|---|
| GPTBot | OpenAI | thu thập dữ liệu để huấn luyện mô hình AI |
| ChatGPT-User | OpenAI | tải trực tiếp cho người dùng ChatGPT |
| OAI-SearchBot | OpenAI | chỉ mục tìm kiếm của ChatGPT |
| ClaudeBot | Anthropic | thu thập dữ liệu để huấn luyện mô hình AI |
| Google-Extended | token kiểm soát việc huấn luyện Gemini | |
| PerplexityBot | Perplexity | chỉ mục tìm kiếm AI |
| CCBot | Common Crawl | kho lưu trữ web mở (được tái sử dụng để huấn luyện AI) |
| Bytespider | ByteDance | thu thập dữ liệu để huấn luyện AI |
| Applebot-Extended | Apple | token kiểm soát việc huấn luyện AI của Apple |
Nguồn và tiêu chuẩn
- RFC 9309: Robots Exclusion Protocol - IETF
- Introduction to robots.txt - Google Search Central
- OpenAI crawlers and bots - OpenAI
Câu hỏi thường gặp
Các quy tắc của tôi có được gửi đến máy chủ không?
Không. robots.txt được tạo hoàn toàn trong trình duyệt của bạn; không có gì được tải lên.
Chặn crawler AI trong robots.txt có ngăn chúng hoàn toàn không?
Không. robots.txt dựa trên sự tuân thủ tự nguyện (RFC 9309). Các crawler AI lớn như GPTBot tuyên bố tôn trọng nó, nhưng những bot bỏ qua quy tắc chỉ có thể bị chặn ở cấp máy chủ hoặc tường lửa.
Disallow có gỡ trang khỏi kết quả tìm kiếm không?
Không. Disallow chỉ ngăn việc thu thập dữ liệu; các URL đã được biết đến vẫn có thể được lập chỉ mục. Hãy dùng thẻ meta noindex khi mục tiêu là gỡ khỏi kết quả tìm kiếm.