Trình tạo robots.txt — kèm preset chặn crawler AI (GPTBot)

Lập trình

Trình tạo robots.txt kết hợp chính sách thu thập dữ liệu, các đường dẫn Disallow, vị trí sitemap và lựa chọn cho phép/chặn crawler AI thành một tệp robots.txt sẵn sàng cho thư mục gốc của trang web của bạn.

Bản dịch có hỗ trợ AI đang được rà soát

Trang này được dịch với sự hỗ trợ của AI và chưa được chuyên gia rà soát. Hãy kiểm tra các nguồn trích dẫn trước khi dùng cho quyết định quan trọng.

Giới thiệu

robots.txt là một tệp văn bản thuần ở thư mục gốc của trang web (/robots.txt), khai báo các quy tắc Allow và Disallow theo từng crawler (User-agent) cùng vị trí sitemap, tuân theo Giao thức Loại trừ Robot RFC 9309. Công cụ này dựng tệp từ chính sách cơ sở và các đường dẫn bị chặn, đồng thời thêm preset cho các crawler AI nổi tiếng như GPTBot, ClaudeBot, PerplexityBot và CCBot. Vì việc tuân thủ là tự nguyện nên robots.txt không phải là một cơ chế bảo mật.

robots.txt = các khối User-agent lặp lại (quy tắc Allow/Disallow) + Sitemap: URL

Cách dùng

  1. 1Chọn chính sách cơ sở (cho phép tất cả hoặc chặn tất cả) và liệt kê các đường dẫn cần chặn.
  2. 2Chọn preset crawler AI và thêm URL sitemap của bạn.
  3. 3Tải xuống robots.txt đã tạo và tải lên thư mục gốc của trang web (/robots.txt).

Tham khảo

Trình tạo robots.txt — kèm preset chặn crawler AI (GPTBot) Tham khảo
CrawlerNhà vận hànhMục đích
GPTBotOpenAIthu thập dữ liệu để huấn luyện mô hình AI
ChatGPT-UserOpenAItải trực tiếp cho người dùng ChatGPT
OAI-SearchBotOpenAIchỉ mục tìm kiếm của ChatGPT
ClaudeBotAnthropicthu thập dữ liệu để huấn luyện mô hình AI
Google-ExtendedGoogletoken kiểm soát việc huấn luyện Gemini
PerplexityBotPerplexitychỉ mục tìm kiếm AI
CCBotCommon Crawlkho lưu trữ web mở (được tái sử dụng để huấn luyện AI)
BytespiderByteDancethu thập dữ liệu để huấn luyện AI
Applebot-ExtendedAppletoken kiểm soát việc huấn luyện AI của Apple

Nguồn và tiêu chuẩn

Câu hỏi thường gặp

Các quy tắc của tôi có được gửi đến máy chủ không?

Không. robots.txt được tạo hoàn toàn trong trình duyệt của bạn; không có gì được tải lên.

Chặn crawler AI trong robots.txt có ngăn chúng hoàn toàn không?

Không. robots.txt dựa trên sự tuân thủ tự nguyện (RFC 9309). Các crawler AI lớn như GPTBot tuyên bố tôn trọng nó, nhưng những bot bỏ qua quy tắc chỉ có thể bị chặn ở cấp máy chủ hoặc tường lửa.

Disallow có gỡ trang khỏi kết quả tìm kiếm không?

Không. Disallow chỉ ngăn việc thu thập dữ liệu; các URL đã được biết đến vẫn có thể được lập chỉ mục. Hãy dùng thẻ meta noindex khi mục tiêu là gỡ khỏi kết quả tìm kiếm.

Công cụ liên quan