Chọn ngôn ngữ

Công cụ kiểm tra robots.txt trực tuyến

Kiểm tra quyền thu thập dữ liệu URL theo chuẩn RFC 9309, phân tích cú pháp theo từng bot tìm kiếm và phát hiện lỗi quy tắc robots.txt ngay trên trình duyệt.

Kiểm tra robots.txtCách hoạt động ↓
Dán nội dung tệp tại /robots.txt. Kiểm tra trực tiếp trên trình duyệt của bạn, không tải dữ liệu lên máy chủ.
Mã định danh bot như Googlebot, GPTBot hoặc ClaudeBot, hoặc chuỗi User-Agent đầy đủ
Mỗi dòng một URL. URL đầy đủ sẽ được rút gọn thành đường dẫn và tham số truy vấn.

Tuân theo chuẩn RFC 9309, bao gồm ký tự đại diện * và ký tự kết thúc $: nhóm riêng của trình thu thập dữ liệu được ưu tiên hơn nhóm *, quy tắc khớp dài nhất sẽ thắng và khi trùng khớp bằng nhau thì ưu tiên Allow. Trình thu thập dữ liệu thực tế có thể khác biệt trong các trường hợp đặc biệt.

Mehmet Demiray Xuất bản Cập nhật
Chia sẻ

Cơ chế khớp lệnh và phân nhóm trong tệp robots.txt

Tệp robots.txt hoạt động dựa trên các nhóm chỉ thị do thẻ User-agent bắt đầu. Khi một trình thu thập dữ liệu (crawler) truy cập trang web, nó cần xác định nhóm chỉ thị nào áp dụng cho mình theo tiêu chuẩn RFC 9309. Quá trình chọn nhóm diễn ra theo thứ tự ưu tiên rất cụ thể: bot tìm nhóm có tên khớp chính xác với mã định danh của nó, nếu không có sẽ tìm tiền tố cha của mã định danh, và cuối cùng mới áp dụng nhóm đại diện chung User-agent: *.

Một điểm cốt lõi mà nhiều quản trị trị trang web hay nhầm lẫn là tính thay thế hoàn toàn của nhóm chỉ định riêng. Nếu tệp có nhóm riêng cho User-agent: Googlebot, trình thu thập của Google sẽ chỉ đọc các dòng Allow và Disallow trong nhóm đó. Toàn bộ các quy tắc nằm trong nhóm User-agent: * bị bỏ qua hoàn toàn đối với Googlebot, chứ không phải được gộp chung lại.

Trong trường hợp trình thu thập có tên dạng ghép như Googlebot-Image, nếu không có khối riêng cho Googlebot-Image, nó sẽ tự động lùi về áp dụng khối Googlebot trước khi lùi về khối *. Nếu tệp chứa nhiều khối có cùng một tên User-agent, trình phân tích cú pháp sẽ tự động gộp tất cả các chỉ thị của các khối đó lại với nhau thành một nhóm duy nhất. Nếu một bot không tìm thấy bất kỳ nhóm nào khớp với tên của mình và tệp cũng không có nhóm *, mặc định bot được phép truy cập mọi đường dẫn trên máy chủ.

Quy tắc khớp chuỗi dài nhất và giải quyết xung đột chỉ thị

Khi một URL khớp với nhiều dòng chỉ thị trong cùng một nhóm, tiêu chuẩn RFC 9309 quy định rõ nguyên tắc: quy tắc có mẫu đường dẫn dài nhất tính theo số lượng ký tự sẽ luôn chiến thắng. Thứ tự xuất hiện trước hay sau trong tệp văn bản không quyết định kết quả.

Bảng so sánh độ ưu tiên khớp mẫu:

Chỉ thị Mẫu đường dẫn URL kiểm tra Kết quả
Disallow /san-pham/ /san-pham/dien-thoai Bị chặn
Allow /san-pham/dien-thoai /san-pham/dien-thoai Được phép (chuỗi dài hơn)
Disallow / /gioi-thieu Bị chặn
Allow /gioi-thieu /gioi-thieu Được phép (chuỗi dài hơn)

Nếu một chỉ thị Allow và một chỉ thị Disallow có cùng độ dài ký tự và cùng khớp với URL, chỉ thị Allow sẽ được ưu tiên áp dụng. Trường hợp một dòng Disallow: để trống không có đường dẫn phía sau, quy tắc này tương đương với việc cho phép truy cập toàn bộ tài nguyên.

Các ký tự đặc biệt cũng đóng vai trò quan trọng trong việc so khớp:

  • Ký tự * đại diện cho một chuỗi gồm 0 hoặc nhiều ký tự bất kỳ.
  • Ký tự $ neo ở cuối chuỗi để xác định điểm kết thúc chính xác của đường dẫn.

Ví dụ: quy tắc Disallow: /*.pdf$ sẽ chặn tất cả các tệp có đuôi tài liệu định dạng PDF ở bất kỳ thư mục nào, nhưng vẫn cho phép URL /tai-lieu.pdf.html vì chuỗi này không kết thúc bằng đuôi pdf.

Kiểm tra quyền truy cập đối với trình thu thập dữ liệu AI

Sự xuất hiện của các mô hình ngôn ngữ lớn đã dẫn đến làn sóng trình thu thập dữ liệu chuyên biệt phục vụ đào tạo trí tuệ nhân tạo, bao gồm GPTBot, ClaudeBot, hay Google-Extended. Quản trị viên cần kiểm soát rõ ràng phần nội dung nào cho phép bot AI khai thác và phần nội dung nào giữ quyền riêng tư.

Để thiết lập các quy tắc chính xác cho bot thế hệ mới, bạn có thể sử dụng trình tạo robots.txt cho AI trước khi đưa nội dung vào công cụ Kiểm tra robots.txt để thẩm định lại. Ngoài ra, việc bổ sung tệp mô tả ngữ cảnh bằng công cụ tạo llms.txt cũng giúp định hướng dữ liệu cho các hệ thống AI một cách có cấu trúc.

Một số hệ thống hiện nay sử dụng chỉ thị Content-Signal để khai báo quyền sử dụng nội dung, chẳng hạn như cho phép tìm kiếm (search), nạp dữ liệu tức thời (ai-input), hoặc đào tạo mô hình dài hạn (ai-train). Công cụ Kiểm tra robots.txt sẽ trích xuất và hiển thị giá trị Content-Signal mà nhóm bot tương ứng đang áp dụng để bạn nắm rõ cấu hình hiện tại. Cần hiểu rằng chỉ thị này mang tính chất công bố tuyên bố bản quyền và mục đích sử dụng, không phải là cơ chế ngăn chặn kỹ thuật ở tầng giao thức.

Các lỗi cú pháp robots.txt thường gặp cần tránh

Khi kiểm tra tệp tin bằng công cụ Kiểm tra robots.txt, hệ thống sẽ phát hiện và cảnh báo các lỗi cú pháp phổ biến làm sai lệch hành vi thu thập dữ liệu của công cụ tìm kiếm:

  1. Đặt chỉ thị trước thẻ User-agent: Mọi dòng Allow hoặc Disallow xuất hiện trước dòng User-agent đầu tiên đều bị coi là vô giá trị và bị bỏ qua.
  2. Đường dẫn không bắt đầu bằng dấu gạch chéo: Đường dẫn hợp lệ phải bắt đầu bằng /. Quy tắc viết dạng Disallow: admin/ là sai cú pháp và không thể so khớp chính xác với thư mục /admin/.
  3. Nhầm lẫn giữa phân biệt chữ hoa và chữ thường: Đường dẫn URL trong robots.txt có phân biệt chữ hoa chữ thường. Quy tắc Disallow: /Private/ sẽ không chặn được URL /private/.
  4. Sử dụng chỉ thị không thuộc chuẩn RFC 9309: Chỉ thị Crawl-delay bị Googlebot bỏ qua hoàn toàn. Các chỉ thị riêng của bên thứ ba như Host hay Clean-param chỉ có hiệu lực trên một số công cụ tìm kiếm đặc thù.
  5. Dùng chỉ thị Noindex trong robots.txt: Google đã dừng hỗ trợ thẻ Noindex đặt trong tệp robots.txt từ năm 2.019. Việc chặn thu thập một trang không đồng nghĩa với việc xóa trang đó khỏi chỉ mục tìm kiếm; nếu trang có liên kết từ bên ngoài trỏ về, liên kết đó vẫn có thể xuất hiện trên kết quả tìm kiếm mà không có mô tả nội dung.

Phạm vi hoạt động và tính bảo mật của công cụ

Công cụ Kiểm tra robots.txt hoạt động hoàn toàn trên trình duyệt của người dùng thông qua mã nguồn cục bộ. Hệ thống không gửi yêu cầu HTTP để tải tệp robots.txt đang chạy thực tế trên máy chủ, cũng như không tải nội dung của các URL được liệt kê.

Nhờ cơ chế xử lý ngoại tuyến này, bạn có thể dán trực tiếp các bản nháp cấu hình, kiểm tra các trang thử nghiệm nội bộ hoặc kiểm tra các môi trường phát triển chưa công bố mà không lo rò rỉ dữ liệu ra bên ngoài máy tính cá nhân. Khi nhập đường dẫn kiểm tra, nếu bạn nhập toàn bộ URL chứa tên miền, công cụ sẽ tự động chuẩn hóa và chỉ giữ lại phần đường dẫn thư mục cùng tham số truy vấn để tiến hành so khớp.

Cần lưu ý rằng tệp robots.txt chỉ là một thỏa ước chỉ dẫn tự nguyện giữa chủ sở hữu trang web và các bot tìm kiếm thiện chí. Robots.txt không thể ngăn chặn các tác nhân độc hại cố tình quét lỗ hổng bảo mật. Để xác thực danh tính thực tế của các bot truy cập máy chủ, bạn cần kết hợp các giải pháp hạ tầng máy chủ như trình tạo khóa xác thực web bot thay vì chỉ phụ thuộc vào tệp văn bản tĩnh.

Những câu chúng tôi trả lời nhiều nhất.

Làm thế nào để kiểm tra một URL có bị chặn bởi tệp robots.txt hay không?

Bạn chỉ cần dán nội dung tệp robots.txt vào vùng nhập liệu, chọn hoặc điền tên bot như Googlebot hoặc GPTBot và nhập danh sách đường dẫn cần kiểm tra. Công cụ Kiểm tra robots.txt sẽ xác định trạng thái cho phép hoặc chặn cho từng URL kèm vị trí dòng quy tắc cụ thể.

Tôi có thể kiểm tra một bản nháp robots.txt trước khi tải lên trang web không?

Hoàn toàn có thể. Công cụ xử lý trực tiếp trên trình duyệt của bạn mà không cần kết nối tới website thực tế hay yêu cầu đăng ký tài khoản. Điều này giúp bạn kiểm thử an toàn các thay đổi cấu hình trước khi triển khai lên máy chủ chính thức.

Nếu một URL khớp với cả chỉ thị Allow và Disallow thì công cụ sẽ xử lý thế nào?

Theo tiêu chuẩn RFC 9309, quy tắc có độ dài khớp dài nhất sẽ giành quyền quyết định. Nếu cả hai chỉ thị Allow và Disallow có độ dài chuỗi khớp bằng nhau, quyền truy cập sẽ được ưu tiên tính là Allow.

Việc chặn bot trong robots.txt có giúp xóa trang web khỏi bảng xếp hạng tìm kiếm không?

Không. Tệp robots.txt chỉ hướng dẫn bot không thu thập dữ liệu trang chứ không ngăn chặn việc lập chỉ mục. Nếu trang web nhận được liên kết từ bên ngoài, công cụ tìm kiếm vẫn có thể hiển thị URL đó trong kết quả tìm kiếm mà không có đoạn trích nội dung.

Công cụ này có điểm gì khác biệt so với trình kiểm tra trong Google Search Console?

Trình kiểm tra của Google Search Console yêu cầu xác minh tên miền và chỉ áp dụng cho Googlebot trên tệp đang phát hành. Trong khi đó, công cụ Kiểm tra robots.txt hỗ trợ kiểm tra linh hoạt bất kỳ bản nháp nào cho nhiều bot khác nhau, bao gồm các quy tắc bot trí tuệ nhân tạo được thiết lập từ bộ tạo robots.txt cho AI.

Tại sao công cụ lại đưa ra cảnh báo cho chỉ thị Crawl-delay?

Chỉ thị Crawl-delay không nằm trong đặc tả kỹ thuật của RFC 9309. Google hoàn toàn bỏ qua chỉ thị này, dù một số công cụ tìm kiếm khác vẫn ghi nhận. Công cụ hiển thị cảnh báo để nhắc bạn tránh phụ thuộc vào chỉ thị này khi tối ưu hóa thu thập dữ liệu.

Ký tự dấu hoa thị và dấu đô la có ý nghĩa gì trong quy tắc robots.txt?

Ký tự dấu hoa thị đại diện cho một chuỗi ký tự bất kỳ, còn dấu đô la đánh dấu vị trí kết thúc của đường dẫn. Ví dụ quy tắc Disallow với đuôi dạng kết thúc bằng dấu đô la cho tệp tài liệu sẽ chặn chính xác các tệp đó mà không ảnh hưởng đến những đường dẫn có chuỗi truy vấn phía sau.