Chọn ngôn ngữ

Trình tạo tệp robots.txt chặn bot AI và trình thu thập dữ liệu

Tạo quy tắc robots.txt để chặn crawler AI thu thập dữ liệu huấn luyện, cấu hình Content-Signal và bảo vệ nội dung website.

Tạo robots.txt chặn bot AICách hoạt động ↓
Lập chỉ mục trang và hiển thị liên kết kèm đoạn trích ngắn
Sử dụng trang làm tài liệu nguồn cho các câu trả lời được tạo
Sử dụng trang để huấn luyện hoặc tinh chỉnh các mô hình AI
Tiện ích mở rộng Cloudflare: phạm vi bot được phép xử lý nội dung đã tìm nạp
Điều khoản pháp lý giúp các tín hiệu có hiệu lực theo luật bản quyền của EU
Chặn các bot này không ảnh hưởng đến khả năng hiển thị tìm kiếm thông thường
Chặn các bot này sẽ loại bỏ bạn khỏi câu trả lời và trích dẫn tìm kiếm của AI
Chặn các bot này sẽ ngăn trợ lý mở trang của bạn theo yêu cầu
Tác nhân tự động nhấp và điền biểu mẫu thay cho người dùng
Dùng / cho toàn bộ trang web hoặc thư mục như /articles/
Chỉ cần thiết cho các con trỏ Sitemap và llms.txt
Được thêm dưới dạng chú thích; robots.txt không có chỉ thị llms.txt

robots.txt và Content-Signal chỉ thể hiện tùy chọn ưu tiên; chúng không tự chặn bất kỳ truy cập nào. Các trình thu thập tuân thủ sẽ tôn trọng quy tắc, các trình khác có thể bỏ qua, và Google cho biết họ không xử lý Content-Signal. Hãy kết hợp với các quy tắc chặn bot ở cấp máy chủ nếu bạn cần thực thi nghiêm ngặt.

Mehmet Demiray Xuất bản Cập nhật
Chia sẻ

Bốn nhóm bot AI phổ biến trên môi trường web

Các hệ thống trí tuệ nhân tạo tương tác với nội dung website thông qua nhiều loại crawler khác nhau. Việc hiểu rõ từng nhóm giúp quản trị viên đưa ra quyết định chặn hay cho phép một cách chính xác mà không làm mất lượt truy cập tiềm năng.

Nhóm đầu tiên là bot thu thập dữ liệu huấn luyện (training data collectors). Các bot này quét toàn bộ website để lấy văn bản, hình ảnh nhằm nạp vào các mô hình ngôn ngữ lớn (LLM). Tiêu biểu trong nhóm này gồm có GPTBot của OpenAI, ClaudeBot của Anthropic, Google-Extended của Google và CCBot của Common Crawl. Việc chặn nhóm này giúp giữ bản quyền nội dung nhưng không ảnh hưởng trực tiếp đến thứ hạng tìm kiếm thông thường.

Nhóm thứ hai là bot lập chỉ mục tìm kiếm AI (AI search indexers). Những crawler này, ví dụ như OAI-SearchBot hay PerplexityBot, tìm kiếm và trích xuất thông tin mới nhất để trả lời câu hỏi kèm liên kết nguồn trực tiếp cho người dùng. Nếu chặn nhóm này, website sẽ biến mất khỏi các kết quả trích dẫn trên công cụ tìm kiếm AI.

Nhóm thứ ba là bot thực thi theo yêu cầu người dùng (user-triggered fetchers), điển hình là ChatGPT-User. Bot này chỉ truy cập một liên kết cụ thể khi người dùng dán URL vào khung chat và yêu cầu tóm tắt.

Nhóm cuối cùng là các tác tử duyệt web tự động (browsing agents) hoạt động như trợ lý cá nhân để thực hiện tác vụ theo ngữ cảnh.

Cấu trúc tệp robots.txt tạo bởi công cụ

Công cụ Tạo robots.txt chặn bot AI biên soạn một tệp cấu hình chuẩn gồm hai lớp bảo vệ rõ ràng, xử lý hoàn toàn trên trình duyệt mà không gửi dữ liệu ra máy chủ bên ngoài.

Lớp đầu tiên là khối đại diện chung User-agent: *. Khối này chứa chỉ thị Allow: / mặc định kèm theo dòng Content-Signal nhằm khai báo quyền sử dụng nội dung cho tìm kiếm, đầu vào AI hoặc huấn luyện mô hình. Tiếp theo, công cụ tạo các khối riêng biệt cho từng bot bị chặn, bao gồm dòng định danh User-agent và đường dẫn cấm Disallow.

Thành phần Mục đích Ví dụ
Content-Signal Khai báo quyền sử dụng nội dung search=yes, ai-train=no
User-agent Định danh bot AI cụ thể User-agent: GPTBot
Disallow Đường dẫn cấm thu thập Disallow: /
Sitemap Chỉ định sơ đồ trang web Sitemap: https://domain.vn/sitemap.xml

Nếu người dùng nhập đường dẫn website, công cụ sẽ tự động chèn thêm dòng Sitemap và gợi ý liên kết đến tệp llms.txt. Mọi thao tác đều áp dụng chung một đường dẫn cấm do người dùng chỉ định, mặc định là toàn bộ website với dấu gạch chéo /.

Tiêu chuẩn Content-Signal và quyền khai thác dữ liệu

Giao thức Content-Signal là một tiêu chuẩn mở được phát triển nhằm giúp chủ sở hữu trang web truyền tải tín hiệu rõ ràng về cách hệ thống AI được phép sử dụng nội dung. Chỉ thị này được đặt trực tiếp bên trong nhóm User-agent: * của tệp robots.txt.

Tiêu chuẩn này hỗ trợ ba tham số chính: search (cho phép lập chỉ mục tìm kiếm thông thường), ai-input (cho phép dùng làm ngữ cảnh trả lời tức thì) và ai-train (cho phép dùng để huấn luyện mô hình AI dài hạn). Mỗi tham số nhận một trong hai giá trị là yes hoặc no. Khi người dùng không chọn tùy chọn nào, giá trị đó sẽ được bỏ qua tương ứng với trạng thái không ưu tiên.

Ngoài ba tín hiệu cốt lõi, tiêu chuẩn còn hỗ trợ phần mở rộng use với các mức độ khai thác như immediate (dùng ngay), reference (tham chiếu) hoặc full (toàn quyền). Khi kích hoạt tùy chọn chính sách bản quyền, công cụ Tạo robots.txt chặn bot AI sẽ bổ sung đoạn ghi chú tham chiếu Điều 4 của Chỉ thị Bản quyền Châu Âu 2019/790 về bảo lưu quyền khai thác văn bản và dữ liệu (TDM reservation).

Chiến lược lựa chọn bot cần chặn theo từng nhu cầu

Mỗi website có định hướng tiếp cận độc giả và kinh doanh khác nhau, do đó việc thiết lập danh sách bot bị chặn cần dựa trên mục tiêu cụ thể.

Trường hợp phổ biến nhất đối với các trang tin tức và blog chuyên ngành là muốn ngăn các công ty AI lấy bài viết để huấn luyện mô hình nhưng vẫn muốn thương hiệu xuất hiện trong các câu trả lời của AI. Với nhu cầu này, cấu hình mặc định chặn riêng nhóm thu thập huấn luyện (training crawlers) là lựa chọn tối ưu. Các bot như GPTBot hay ClaudeBot sẽ bị chặn, trong khi OAI-SearchBot hay PerplexityBot vẫn có thể truy cập để trích nguồn.

Đối với các nền tảng chứa nội dung độc quyền, khóa học trả phí hoặc tài liệu bảo mật, cấu hình chặn toàn bộ bot AI là phương án an toàn nhất. Ngược lại, nếu chỉ muốn thiết lập ranh giới cho các thư mục nháp hoặc tài liệu nội bộ, người dùng có thể tùy chỉnh đường dẫn cấm thành /drafts/ hoặc /private/ thay vì cấm trên toàn trang.

Sau khi tạo xong tệp cấu hình, bạn có thể sử dụng công cụ kiểm tra robots.txt để rà soát lại xem các quy tắc đã khớp chính xác với từng crawler hay chưa.

Giới hạn của robots.txt và giải pháp bảo vệ máy chủ

Tệp robots.txt và chỉ thị Content-Signal hoạt động dựa trên nguyên tắc tự nguyện tuân thủ. Các tổ chức công nghệ lớn như OpenAI, Anthropic hay Google cam kết tôn trọng các chỉ thị này, nhưng robots.txt không phải là một bức tường lửa kỹ thuật.

Những crawler không chính thức hoặc công cụ quét dữ liệu trái phép có thể hoàn toàn phớt lờ chỉ thị Disallow. Bên cạnh đó, việc chặn bot ở thời điểm hiện tại không thể xóa bỏ dữ liệu mà các mô hình đã thu thập và huấn luyện trong quá khứ.

Để bảo vệ tài nguyên máy chủ và nội dung website một cách triệt để, quản trị viên nên kết hợp nhiều lớp phòng thủ:

  1. Triển khai quy tắc tường lửa ứng dụng web (WAF) hoặc dịch vụ mạng phân phối nội dung (CDN) để chặn IP và danh danh chuỗi đại diện người dùng độc hại.
  2. Áp dụng cơ chế giới hạn tần suất truy cập (rate limiting) nhằm ngăn chặn hành vi quét tự động hàng loạt gây quá tải máy chủ.
  3. Sử dụng công cụ tạo khóa xác thực bot web để xác thực danh tính crawler thông qua chữ ký mật mã thay vì chỉ tin tưởng chuỗi định danh người dùng tự xưng.

Phân biệt tệp robots.txt và tệp llms.txt

Trong kỷ nguyên AI, hai tệp cấu hình robots.txt và llms.txt phục vụ hai mục đích hoàn toàn khác biệt nhưng bổ trợ chặt chẽ cho nhau trên máy chủ website.

Tệp robots.txt đặt tại thư mục gốc là công cụ điều phối kỹ thuật, thông báo cho crawler biết những trang nào được phép truy cập và trang nào bị cấm. Trong khi đó, llms.txt là một tệp định dạng Markdown cung cấp bản tóm tắt nội dung có cấu trúc rõ ràng, giúp các mô hình ngôn ngữ lớn hiểu nhanh thông tin cốt lõi của website mà không cần phân tích toàn bộ mã HTML phức tạp.

Do tiêu chuẩn kỹ thuật của robots.txt không hỗ trợ chỉ thị chính thức nào dành riêng cho llms.txt, công cụ Tạo robots.txt chặn bot AI sẽ chèn đường dẫn này dưới dạng một dòng ghi chú bắt đầu bằng dấu #. Bạn có thể sử dụng công cụ tạo llms.txt để xây dựng tệp tài liệu tóm tắt đạt chuẩn cho website của mình trước khi công bố liên kết.

Những câu chúng tôi trả lời nhiều nhất.

Làm thế nào để áp dụng file robots.txt sau khi tạo?

Bạn chỉ cần tải file robots.txt về máy tính hoặc sao chép nội dung được tạo từ công cụ Tạo robots.txt chặn bot AI, sau đó tải file lên thư mục gốc của tên miền website. Sau khi tải lên hoàn tất, bạn có thể dùng công cụ kiểm tra robots.txt để kiểm tra xem cấu hình đã hoạt động chính xác và chặn đúng các bot mong muốn hay chưa.

Chặn bot huấn luyện AI khác gì so với chặn bot tìm kiếm AI?

Bot huấn luyện AI như GPTBot hay ClaudeBot thu thập dữ liệu trang web để đào tạo các mô hình ngôn ngữ lớn, việc chặn nhóm này không ảnh hưởng đến lưu lượng truy cập trực tiếp. Ngược lại, bot tìm kiếm AI như OAI-SearchBot thu thập nội dung để hiển thị nguồn trích dẫn và liên kết khi người dùng đặt câu hỏi. Nếu chặn bot tìm kiếm AI, website của bạn sẽ mất cơ hội xuất hiện trong các câu trả lời trích dẫn từ công cụ AI.

Việc chặn bot AI có làm giảm thứ hạng tìm kiếm trên Google không?

Việc này không làm giảm thứ hạng SEO thông thường trên Google Tìm kiếm. Google sử dụng Googlebot để lập chỉ mục tìm kiếm và sử dụng Google-Extended riêng biệt cho việc huấn luyện mô hình Gemini. Khi bạn chọn chặn Google-Extended, bot tìm kiếm chính của Google vẫn thu thập dữ liệu bình thường và website của bạn vẫn duy trì kết quả hiển thị SEO đầy đủ.

Chỉ thị Content-Signal trong file robots.txt có ý nghĩa gì?

Content-Signal là giao thức hiện đại cho phép quản trị viên website tuyên bố quyền sử dụng dữ liệu đối với các hệ thống AI qua ba tham số gồm tìm kiếm, nạp ngữ cảnh và huấn luyện mô hình. Khác với lệnh Disallow truyền thống chỉ yêu cầu bot dừng tải trang, Content-Signal quy định rõ mục đích nội dung được phép hoặc không được phép khai thác.

File robots.txt có thể ngăn chặn triệt để mọi hành vi cào dữ liệu không?

robots.txt là tiêu chuẩn mang tính tự nguyện mà các tổ chức AI uy tín tuân thủ. Những bot thu thập dữ liệu trái phép hoặc ẩn danh vẫn có thể bỏ qua chỉ thị này. Để bảo vệ dữ liệu toàn diện hơn, bạn nên kết hợp robots.txt với tường lửa WAF trên máy chủ hoặc sử dụng trình tạo khóa xác thực web bot để kiểm soát crawler qua chữ ký mật mã.

Tại sao dòng Sitemap và llms.txt không xuất hiện trong file robots.txt vừa tạo?

Hai dòng này chỉ tự động hiển thị khi bạn nhập đầy đủ địa chỉ URL hợp lệ của website vào biểu mẫu. Dòng Sitemap giúp bot nhận diện sơ đồ trang web nhanh chóng, trong khi ghi chú trỏ đến llms.txt cung cấp tài liệu tóm tắt cho mô hình ngôn ngữ lớn. Bạn có thể xây dựng file này thông qua công cụ tạo llms.txt.