Bốn nhóm bot AI phổ biến trên môi trường web
Các hệ thống trí tuệ nhân tạo tương tác với nội dung website thông qua nhiều loại crawler khác nhau. Việc hiểu rõ từng nhóm giúp quản trị viên đưa ra quyết định chặn hay cho phép một cách chính xác mà không làm mất lượt truy cập tiềm năng.
Nhóm đầu tiên là bot thu thập dữ liệu huấn luyện (training data collectors). Các bot này quét toàn bộ website để lấy văn bản, hình ảnh nhằm nạp vào các mô hình ngôn ngữ lớn (LLM). Tiêu biểu trong nhóm này gồm có GPTBot của OpenAI, ClaudeBot của Anthropic, Google-Extended của Google và CCBot của Common Crawl. Việc chặn nhóm này giúp giữ bản quyền nội dung nhưng không ảnh hưởng trực tiếp đến thứ hạng tìm kiếm thông thường.
Nhóm thứ hai là bot lập chỉ mục tìm kiếm AI (AI search indexers). Những crawler này, ví dụ như OAI-SearchBot hay PerplexityBot, tìm kiếm và trích xuất thông tin mới nhất để trả lời câu hỏi kèm liên kết nguồn trực tiếp cho người dùng. Nếu chặn nhóm này, website sẽ biến mất khỏi các kết quả trích dẫn trên công cụ tìm kiếm AI.
Nhóm thứ ba là bot thực thi theo yêu cầu người dùng (user-triggered fetchers), điển hình là ChatGPT-User. Bot này chỉ truy cập một liên kết cụ thể khi người dùng dán URL vào khung chat và yêu cầu tóm tắt.
Nhóm cuối cùng là các tác tử duyệt web tự động (browsing agents) hoạt động như trợ lý cá nhân để thực hiện tác vụ theo ngữ cảnh.
Cấu trúc tệp robots.txt tạo bởi công cụ
Công cụ Tạo robots.txt chặn bot AI biên soạn một tệp cấu hình chuẩn gồm hai lớp bảo vệ rõ ràng, xử lý hoàn toàn trên trình duyệt mà không gửi dữ liệu ra máy chủ bên ngoài.
Lớp đầu tiên là khối đại diện chung User-agent: *. Khối này chứa chỉ thị Allow: / mặc định kèm theo dòng Content-Signal nhằm khai báo quyền sử dụng nội dung cho tìm kiếm, đầu vào AI hoặc huấn luyện mô hình. Tiếp theo, công cụ tạo các khối riêng biệt cho từng bot bị chặn, bao gồm dòng định danh User-agent và đường dẫn cấm Disallow.
| Thành phần |
Mục đích |
Ví dụ |
Content-Signal |
Khai báo quyền sử dụng nội dung |
search=yes, ai-train=no |
User-agent |
Định danh bot AI cụ thể |
User-agent: GPTBot |
Disallow |
Đường dẫn cấm thu thập |
Disallow: / |
Sitemap |
Chỉ định sơ đồ trang web |
Sitemap: https://domain.vn/sitemap.xml |
Nếu người dùng nhập đường dẫn website, công cụ sẽ tự động chèn thêm dòng Sitemap và gợi ý liên kết đến tệp llms.txt. Mọi thao tác đều áp dụng chung một đường dẫn cấm do người dùng chỉ định, mặc định là toàn bộ website với dấu gạch chéo /.
Tiêu chuẩn Content-Signal và quyền khai thác dữ liệu
Giao thức Content-Signal là một tiêu chuẩn mở được phát triển nhằm giúp chủ sở hữu trang web truyền tải tín hiệu rõ ràng về cách hệ thống AI được phép sử dụng nội dung. Chỉ thị này được đặt trực tiếp bên trong nhóm User-agent: * của tệp robots.txt.
Tiêu chuẩn này hỗ trợ ba tham số chính: search (cho phép lập chỉ mục tìm kiếm thông thường), ai-input (cho phép dùng làm ngữ cảnh trả lời tức thì) và ai-train (cho phép dùng để huấn luyện mô hình AI dài hạn). Mỗi tham số nhận một trong hai giá trị là yes hoặc no. Khi người dùng không chọn tùy chọn nào, giá trị đó sẽ được bỏ qua tương ứng với trạng thái không ưu tiên.
Ngoài ba tín hiệu cốt lõi, tiêu chuẩn còn hỗ trợ phần mở rộng use với các mức độ khai thác như immediate (dùng ngay), reference (tham chiếu) hoặc full (toàn quyền). Khi kích hoạt tùy chọn chính sách bản quyền, công cụ Tạo robots.txt chặn bot AI sẽ bổ sung đoạn ghi chú tham chiếu Điều 4 của Chỉ thị Bản quyền Châu Âu 2019/790 về bảo lưu quyền khai thác văn bản và dữ liệu (TDM reservation).
Chiến lược lựa chọn bot cần chặn theo từng nhu cầu
Mỗi website có định hướng tiếp cận độc giả và kinh doanh khác nhau, do đó việc thiết lập danh sách bot bị chặn cần dựa trên mục tiêu cụ thể.
Trường hợp phổ biến nhất đối với các trang tin tức và blog chuyên ngành là muốn ngăn các công ty AI lấy bài viết để huấn luyện mô hình nhưng vẫn muốn thương hiệu xuất hiện trong các câu trả lời của AI. Với nhu cầu này, cấu hình mặc định chặn riêng nhóm thu thập huấn luyện (training crawlers) là lựa chọn tối ưu. Các bot như GPTBot hay ClaudeBot sẽ bị chặn, trong khi OAI-SearchBot hay PerplexityBot vẫn có thể truy cập để trích nguồn.
Đối với các nền tảng chứa nội dung độc quyền, khóa học trả phí hoặc tài liệu bảo mật, cấu hình chặn toàn bộ bot AI là phương án an toàn nhất. Ngược lại, nếu chỉ muốn thiết lập ranh giới cho các thư mục nháp hoặc tài liệu nội bộ, người dùng có thể tùy chỉnh đường dẫn cấm thành /drafts/ hoặc /private/ thay vì cấm trên toàn trang.
Sau khi tạo xong tệp cấu hình, bạn có thể sử dụng công cụ kiểm tra robots.txt để rà soát lại xem các quy tắc đã khớp chính xác với từng crawler hay chưa.
Giới hạn của robots.txt và giải pháp bảo vệ máy chủ
Tệp robots.txt và chỉ thị Content-Signal hoạt động dựa trên nguyên tắc tự nguyện tuân thủ. Các tổ chức công nghệ lớn như OpenAI, Anthropic hay Google cam kết tôn trọng các chỉ thị này, nhưng robots.txt không phải là một bức tường lửa kỹ thuật.
Những crawler không chính thức hoặc công cụ quét dữ liệu trái phép có thể hoàn toàn phớt lờ chỉ thị Disallow. Bên cạnh đó, việc chặn bot ở thời điểm hiện tại không thể xóa bỏ dữ liệu mà các mô hình đã thu thập và huấn luyện trong quá khứ.
Để bảo vệ tài nguyên máy chủ và nội dung website một cách triệt để, quản trị viên nên kết hợp nhiều lớp phòng thủ:
- Triển khai quy tắc tường lửa ứng dụng web (WAF) hoặc dịch vụ mạng phân phối nội dung (CDN) để chặn IP và danh danh chuỗi đại diện người dùng độc hại.
- Áp dụng cơ chế giới hạn tần suất truy cập (rate limiting) nhằm ngăn chặn hành vi quét tự động hàng loạt gây quá tải máy chủ.
- Sử dụng công cụ tạo khóa xác thực bot web để xác thực danh tính crawler thông qua chữ ký mật mã thay vì chỉ tin tưởng chuỗi định danh người dùng tự xưng.
Phân biệt tệp robots.txt và tệp llms.txt
Trong kỷ nguyên AI, hai tệp cấu hình robots.txt và llms.txt phục vụ hai mục đích hoàn toàn khác biệt nhưng bổ trợ chặt chẽ cho nhau trên máy chủ website.
Tệp robots.txt đặt tại thư mục gốc là công cụ điều phối kỹ thuật, thông báo cho crawler biết những trang nào được phép truy cập và trang nào bị cấm. Trong khi đó, llms.txt là một tệp định dạng Markdown cung cấp bản tóm tắt nội dung có cấu trúc rõ ràng, giúp các mô hình ngôn ngữ lớn hiểu nhanh thông tin cốt lõi của website mà không cần phân tích toàn bộ mã HTML phức tạp.
Do tiêu chuẩn kỹ thuật của robots.txt không hỗ trợ chỉ thị chính thức nào dành riêng cho llms.txt, công cụ Tạo robots.txt chặn bot AI sẽ chèn đường dẫn này dưới dạng một dòng ghi chú bắt đầu bằng dấu #. Bạn có thể sử dụng công cụ tạo llms.txt để xây dựng tệp tài liệu tóm tắt đạt chuẩn cho website của mình trước khi công bố liên kết.