كيف تعمل مطابقة القواعد واختيار المجموعات في robots.txt
يعتمد ملف robots.txt على معيار RFC 9309 لتنظيم وصول روبوتات البحث والزواحف إلى صفحات الموقع. يتكون الملف من مجموعات توجيهية تبدأ كل منها بسطر واحد أو أكثر من User-agent، متبوعة بقواعد السماح Allow والحظر Disallow. عندما يزور أي زاحف الموقع، فإنه يبحث عن المجموعة المخصصة له أولا باستخدام اسمه البرمجي المحدد.
تتبع عملية اختيار المجموعة تسلسلا دقيقا: يبحث الزاحف عن اسمه المطابق تماما، مثل GPTBot أو Googlebot. إذا لم يجد تطابقا مباشرا، يبحث عن الرمز الأصلي في حال كان اسمه مركبا ومفصولا بشرطة، فمثلا يعود زاحف Googlebot-Image إلى مجموعة Googlebot عند غياب مجموعته المنفصلة. إذا لم تتوفر أي مجموعة مطابقة للاسم، ينتقل الزاحف تلقائيا إلى المجموعة العامة المحددة بالرمز *.
من النقاط الجوهرية في عمل الملف أن اختيار الزاحف لمجموعته الخاصة يلغي المجموعة العامة * بالكامل ولا يدمج القواعد بينهما. إذا احتوت المجموعة العامة على 10 قواعد حظر، واحتوت مجموعة الزاحف المحددة على قاعدة واحدة فقط، فإن الزاحف سيلتزم بالقاعدة الوحيدة داخل مجموعته ويتجاهل تماما كل ما ورد تحت رمز النجمة. يساعدك فاحص ملف robots.txt على محاكاة هذه الآلية بدقة، وتحديد المجموعة الفعلية التي تطبق على كل زاحف دون الحاجة إلى تخمين النتيجة.
أسبقية القواعد ومبدأ فوز المسار الأطول
عندما ينطبق أكثر من سطر توجيهي على رابط معين داخل نفس المجموعة، تطبق محركات البحث معيار المسار الأكثر تحديدا، وهو ما يعرف بقاعدة فوز المسار الأطول من حيث عدد الحروف والرموز. لا يعتمد الحسم على الترتيب الرأسي للأوامر في الملف، بل على دقة النمط ومطابقته للرابط المطلوب.
يوضح الجدول التالي كيفية تطبيق هذه القاعدة عند تعارض التوجيهات:
| الرابط المختبر |
قاعدة Allow |
قاعدة Disallow |
النتيجة النهائية |
/blog/posts/tech |
Allow: /blog/posts/ |
Disallow: /blog/ |
مسموح (Allow أطول) |
/private/user/data |
Allow: /private/ |
Disallow: /private/user/ |
محظور (Disallow أطول) |
/news/arabic |
Allow: /news/ |
Disallow: /news/ |
مسموح (التعادل يرجح السماح) |
/files/doc.pdf |
Allow: /files/ |
Disallow: /*.pdf$ |
محظور (نمط الامتداد أطول) |
يدعم المعيار استخدام الرمز * لتمثيل أي عدد من المحارف المتتالية، والرمز $ لتحديد نهاية المسار. إذا تساوى طول قاعدة Allow مع قاعدة Disallow تماما في عدد الحروف، فإن الأسبقية تمنح تلقائيا لخيار السماح. في حال عدم مطابقة الرابط لأي قاعدة داخل المجموعة، أو إذا ورد أمر Disallow: فارغا دون مسار، فإن الرابط يعد مسموحا به بشكل افتراضي.
اختبار زواحف الذكاء الاصطناعي وتوجيه Content-Signal
تتطلب إدارة المحتوى الرقمي الحديثة التمييز بين محركات البحث التقليدية وزواحف جمع البيانات لتدريب نماذج الذكاء الاصطناعي. تخصص شركات الذكاء الاصطناعي معرفات مميزة لزواحفها، مثل GPTBot وClaudeBot وGoogle-Extended وPerplexityBot، مما يتيح لك التحكم في سلوك كل أداة بشكل منفصل.
ظهرت مؤخرا توجيهات حديثة مثل Content-Signal داخل ملفات التوجيه، والتي تحدد تفضيلات الترخيص والاستخدام، مثل search للسماح بالظهور في نتائج البحث، أو ai-input وai-train لإدارة استخدام المحتوى في التغذية والتدريب الخوارزمي. يقوم فاحص ملف robots.txt بتحليل هذه الأسطر وقراءتها ضمن كل مجموعة لعرضها بوضوح في تقرير الفحص، مع الإشارة إلى أن هذه التوجيهات تعبر عن سياسات ترخيص وليست حظرا تقنيا مباشرا.
يمكنك الاعتماد على مولد ملف robots.txt لبوتات الذكاء الاصطناعي لصياغة هذه المجموعات باحترافية، ثم نسخ النص واختبار المسارات هنا للتأكد من حماية المواد الحساسة، بالتكامل مع ملفات الهيكلة المتقدمة مثل ملف llms.txt.
نطاق الفحص وخصوصية المعالجة المحلية داخل المتصفح
يعمل فاحص ملف robots.txt بالكامل داخل متصفح الإنترنت دون إرسال البيانات أو نصوص الملفات إلى أي خادم خارجي. تضمن هذه الآلية حماية تامة للمسودات وقواعد البيانات والمسارات التجريبية الخاصة بالمشاريع غير المعلنة أو بيئات التطوير الداخلية.
تعتمد الأداة على لصق نص الملف والروابط المراد فحصها مباشرة، وتجري محاكاة رياضية دقيقة لمعيار RFC 9309. لا تقوم الأداة بجلب الملفات الحية تلقائيا عبر الشبكة لتفادي مشكلات الجدران النارية والشهادات الرقمية، كما أنها تفصل المسارات المكتوبة عن أسماء النطاقات لاختبار المسار ونصوص الاستعلام حصرا.
توفر هذه البيئة المحلية حرية كاملة لتجربة التعديلات والسيناريوهات المتعددة قبل نشر الملف على الخادم الفعلي، مع إمكانية تصدير التقارير وجداول المطابقة بصيغة CSV لمشاركتها مع فريق العمل التقني وضمان جاهزية الموقع للأرشفة.