Cơ chế khớp lệnh và phân nhóm trong tệp robots.txt
Tệp robots.txt hoạt động dựa trên các nhóm chỉ thị do thẻ User-agent bắt đầu. Khi một trình thu thập dữ liệu (crawler) truy cập trang web, nó cần xác định nhóm chỉ thị nào áp dụng cho mình theo tiêu chuẩn RFC 9309. Quá trình chọn nhóm diễn ra theo thứ tự ưu tiên rất cụ thể: bot tìm nhóm có tên khớp chính xác với mã định danh của nó, nếu không có sẽ tìm tiền tố cha của mã định danh, và cuối cùng mới áp dụng nhóm đại diện chung User-agent: *.
Một điểm cốt lõi mà nhiều quản trị trị trang web hay nhầm lẫn là tính thay thế hoàn toàn của nhóm chỉ định riêng. Nếu tệp có nhóm riêng cho User-agent: Googlebot, trình thu thập của Google sẽ chỉ đọc các dòng Allow và Disallow trong nhóm đó. Toàn bộ các quy tắc nằm trong nhóm User-agent: * bị bỏ qua hoàn toàn đối với Googlebot, chứ không phải được gộp chung lại.
Trong trường hợp trình thu thập có tên dạng ghép như Googlebot-Image, nếu không có khối riêng cho Googlebot-Image, nó sẽ tự động lùi về áp dụng khối Googlebot trước khi lùi về khối *. Nếu tệp chứa nhiều khối có cùng một tên User-agent, trình phân tích cú pháp sẽ tự động gộp tất cả các chỉ thị của các khối đó lại với nhau thành một nhóm duy nhất. Nếu một bot không tìm thấy bất kỳ nhóm nào khớp với tên của mình và tệp cũng không có nhóm *, mặc định bot được phép truy cập mọi đường dẫn trên máy chủ.