اختيار اللغة

أداة فحص واختبار ملف robots.txt للروابط وعناكب البحث

تحقق من قواعد الزحف والوصول لعناكب البحث ونماذج الذكاء الاصطناعي فوراً في المتصفح مع كشف الأخطاء وتحديد السطر الحاسم لكل مسار.

فاحص ملف robots.txtكيف يعمل؟ ↓
الصق الملف كما يتم تقديمه على /robots.txt. يتم الفحص في متصفحك دون رفع أو جلب أي بيانات.
رمز منتج مثل Googlebot أو GPTBot أو ClaudeBot، أو سلسلة User-Agent كاملة
رابط واحد لكل سطر. يتم اختصار الروابط الكاملة إلى المسار والاستعلام.

يتبع معيار RFC 9309 بما في ذلك حرف البدل * وعلامة النهاية $: تحظى المجموعة الخاصة بالزاحف بالأولوية على مجموعة *، وتفوز أطول قاعدة مطابقة، وتُمنح الأولوية في حالة التعادل لخيار Allow. قد تختلف برامج الزحف الحقيقية في بعض الحالات الخاصة.

Mehmet Demiray (محمد ديميراي) نُشِر آخر تحديث
مشاركة

كيف تعمل مطابقة القواعد واختيار المجموعات في robots.txt

يعتمد ملف robots.txt على معيار RFC 9309 لتنظيم وصول روبوتات البحث والزواحف إلى صفحات الموقع. يتكون الملف من مجموعات توجيهية تبدأ كل منها بسطر واحد أو أكثر من User-agent، متبوعة بقواعد السماح Allow والحظر Disallow. عندما يزور أي زاحف الموقع، فإنه يبحث عن المجموعة المخصصة له أولا باستخدام اسمه البرمجي المحدد.

تتبع عملية اختيار المجموعة تسلسلا دقيقا: يبحث الزاحف عن اسمه المطابق تماما، مثل GPTBot أو Googlebot. إذا لم يجد تطابقا مباشرا، يبحث عن الرمز الأصلي في حال كان اسمه مركبا ومفصولا بشرطة، فمثلا يعود زاحف Googlebot-Image إلى مجموعة Googlebot عند غياب مجموعته المنفصلة. إذا لم تتوفر أي مجموعة مطابقة للاسم، ينتقل الزاحف تلقائيا إلى المجموعة العامة المحددة بالرمز *.

من النقاط الجوهرية في عمل الملف أن اختيار الزاحف لمجموعته الخاصة يلغي المجموعة العامة * بالكامل ولا يدمج القواعد بينهما. إذا احتوت المجموعة العامة على 10 قواعد حظر، واحتوت مجموعة الزاحف المحددة على قاعدة واحدة فقط، فإن الزاحف سيلتزم بالقاعدة الوحيدة داخل مجموعته ويتجاهل تماما كل ما ورد تحت رمز النجمة. يساعدك فاحص ملف robots.txt على محاكاة هذه الآلية بدقة، وتحديد المجموعة الفعلية التي تطبق على كل زاحف دون الحاجة إلى تخمين النتيجة.

أسبقية القواعد ومبدأ فوز المسار الأطول

عندما ينطبق أكثر من سطر توجيهي على رابط معين داخل نفس المجموعة، تطبق محركات البحث معيار المسار الأكثر تحديدا، وهو ما يعرف بقاعدة فوز المسار الأطول من حيث عدد الحروف والرموز. لا يعتمد الحسم على الترتيب الرأسي للأوامر في الملف، بل على دقة النمط ومطابقته للرابط المطلوب.

يوضح الجدول التالي كيفية تطبيق هذه القاعدة عند تعارض التوجيهات:

الرابط المختبر قاعدة Allow قاعدة Disallow النتيجة النهائية
/blog/posts/tech Allow: /blog/posts/ Disallow: /blog/ مسموح (Allow أطول)
/private/user/data Allow: /private/ Disallow: /private/user/ محظور (Disallow أطول)
/news/arabic Allow: /news/ Disallow: /news/ مسموح (التعادل يرجح السماح)
/files/doc.pdf Allow: /files/ Disallow: /*.pdf$ محظور (نمط الامتداد أطول)

يدعم المعيار استخدام الرمز * لتمثيل أي عدد من المحارف المتتالية، والرمز $ لتحديد نهاية المسار. إذا تساوى طول قاعدة Allow مع قاعدة Disallow تماما في عدد الحروف، فإن الأسبقية تمنح تلقائيا لخيار السماح. في حال عدم مطابقة الرابط لأي قاعدة داخل المجموعة، أو إذا ورد أمر Disallow: فارغا دون مسار، فإن الرابط يعد مسموحا به بشكل افتراضي.

اختبار زواحف الذكاء الاصطناعي وتوجيه Content-Signal

تتطلب إدارة المحتوى الرقمي الحديثة التمييز بين محركات البحث التقليدية وزواحف جمع البيانات لتدريب نماذج الذكاء الاصطناعي. تخصص شركات الذكاء الاصطناعي معرفات مميزة لزواحفها، مثل GPTBot وClaudeBot وGoogle-Extended وPerplexityBot، مما يتيح لك التحكم في سلوك كل أداة بشكل منفصل.

ظهرت مؤخرا توجيهات حديثة مثل Content-Signal داخل ملفات التوجيه، والتي تحدد تفضيلات الترخيص والاستخدام، مثل search للسماح بالظهور في نتائج البحث، أو ai-input وai-train لإدارة استخدام المحتوى في التغذية والتدريب الخوارزمي. يقوم فاحص ملف robots.txt بتحليل هذه الأسطر وقراءتها ضمن كل مجموعة لعرضها بوضوح في تقرير الفحص، مع الإشارة إلى أن هذه التوجيهات تعبر عن سياسات ترخيص وليست حظرا تقنيا مباشرا.

يمكنك الاعتماد على مولد ملف robots.txt لبوتات الذكاء الاصطناعي لصياغة هذه المجموعات باحترافية، ثم نسخ النص واختبار المسارات هنا للتأكد من حماية المواد الحساسة، بالتكامل مع ملفات الهيكلة المتقدمة مثل ملف llms.txt.

أبرز الأخطاء الشائعة والتحذيرات النحوية في الملف

يقع العديد من مديري المواقع في أخطاء صياغة تؤدي إلى تعطيل الزحف أو فتح مسارات خاصة دون قصد. يعمل فاحص ملف robots.txt على اكتشاف هذه الأخطاء وإصدار تنبيهات واضحة حولها:

  1. وضع قواعد التوجيه في بداية الملف قبل تعريف أي User-agent، مما يجعل تلك القواعد مهملة تماما لعدم انتمائها لأي مجموعة.
  2. كتابة مسارات نسبية لا تبدأ بالشرطة المائلة /، فالمسار يجب أن يبدأ دائما من جذر النطاق مثل Disallow: /admin.
  3. الاعتماد على توجيه Crawl-delay، وهو أمر غير معترف به في معيار RFC 9309 وتتجاهله محركات كبرى مثل Google.
  4. تضمين أوامر غير معيارية مثل Noindex داخل الملف، حيث أوقفت محركات البحث دعمه عبر robots.txt واعتمدت بدلا منه وسوم الميتا داخل صفحات HTML.
  5. تجاهل حساسية حالة الأحرف، فالمسار /Products يختلف تقنيا عن /products في مطابقة القواعد.

يجب الانتباه أيضا إلى الفرق بين الزحف والفهرسة، فمنع الزاحف من الوصول إلى الرابط عبر robots.txt لا يضمن حذفه من نتائج البحث إذا كانت هناك روابط خارجية تشير إليه. للتحقق من هوية الزواحف المتقدمة والتأكد من عدم تزييفها لمعرف المستخدم، يمكن الاستعانة بأدوات مثل مولد مفاتيح مصادقة بوتات الويب.

نطاق الفحص وخصوصية المعالجة المحلية داخل المتصفح

يعمل فاحص ملف robots.txt بالكامل داخل متصفح الإنترنت دون إرسال البيانات أو نصوص الملفات إلى أي خادم خارجي. تضمن هذه الآلية حماية تامة للمسودات وقواعد البيانات والمسارات التجريبية الخاصة بالمشاريع غير المعلنة أو بيئات التطوير الداخلية.

تعتمد الأداة على لصق نص الملف والروابط المراد فحصها مباشرة، وتجري محاكاة رياضية دقيقة لمعيار RFC 9309. لا تقوم الأداة بجلب الملفات الحية تلقائيا عبر الشبكة لتفادي مشكلات الجدران النارية والشهادات الرقمية، كما أنها تفصل المسارات المكتوبة عن أسماء النطاقات لاختبار المسار ونصوص الاستعلام حصرا.

توفر هذه البيئة المحلية حرية كاملة لتجربة التعديلات والسيناريوهات المتعددة قبل نشر الملف على الخادم الفعلي، مع إمكانية تصدير التقارير وجداول المطابقة بصيغة CSV لمشاركتها مع فريق العمل التقني وضمان جاهزية الموقع للأرشفة.

الأكثر شيوعًا.

كيف يمكنني فحص ما إذا كان رابط معين محظورًا في ملف robots.txt؟

يمكنك لصق محتوى ملفك داخل فاحص ملف robots.txt، ثم كتابة اسم الزاحف مثل Googlebot أو GPTBot، وإدراج المسارات أو الروابط المراد اختبارها. تعرض الأداة فورًا حكم الوصول لكل رابط مبينة السطر والقاعدة المحددة التي حسمت النتيجة سواء بالقبول أو الحظر.

ماذا يحدث عند تعارض قاعدتي Allow و Disallow للرابط نفسه؟

تطبق الأداة معيار RFC 9309، حيث تفوز دائمًا القاعدة ذات المسار الأطول والأكثر تحديدًا. وفي حال تطابق طول مسار قاعدة Allow مع طول قاعدة Disallow تمامًا، تمنح الأسبقية لقاعدة Allow ويُسمح للزاحف بالوصول.

هل يؤدي حظر الرابط في ملف robots.txt إلى حذفه من نتائج محركات البحث؟

لا يحذف ملف robots.txt الصفحات من الفهرس، بل يمنع الزواحف من تنزيل محتواها فقط. إذا كانت هناك روابط خارجية تؤدي إلى تلك الصفحة، فقد تستمر محركات البحث في فهرستها وعرض عنوان الرابط بدون مقتطف نصي.

كيف أختبر قواعد الوصول الخاصة بزواحف الذكاء الاصطناعي؟

يمكنك إدخال اسم زاحف الذكاء الاصطناعي مثل GPTBot أو ClaudeBot واختبار القواعد المطبقة عليه داخل الأداة مباشرة. وإذا كنت بحاجة إلى صياغة ملف يحدد حقوق التدريب والاستخدام بدقة قبل اختباره، يمكنك الاستعانة عبر أداة إنشاء ملف robots.txt لزواحف الذكاء الاصطناعي.

لماذا تعتمد الأداة على لصق النص بدلًا من جلب الملف الحي من الموقع؟

صُممت الأداة لتعمل بالكامل محليًا داخل متصفحك، مما يتيح لك تجربة المسودات وتعديل القواعد قبل نشرها على موقعك الحي، فضلًا عن الحفاظ على سرية بنية الروابط الداخلية الخاصة بك دون نقل أي بيانات.

ما الغرض من استخدام الرمزين * و $ في صياغة القواعد؟

يستخدم الرمز * كمحرف بديل لمطابقة أي تتابع من الحروف أو الأرقام داخل المسار، بينما يحدد الرمز $ نهاية الرابط بدقة. تمكنك هذه الرموز من استهداف صيغ ملفات محددة، مثل حظر الملفات المنتهية بالامتداد pdf.

هل يمنع ملف robots.txt عمليات الاستخراج والكشط غير المصرح بها؟

يعتبر ملف robots.txt معيارًا تنظيميًا تلتزم به برمجيات الزحف الرسمية طوعًا، ولا يعد حاجزًا أمنيًا ضد البوتات الضارة. للتحقق من هوية الزواحف ومطابقتها للمعايير المعتمدة، يمكنك الاستفادة من أداة توليد مفاتيح توثيق البوتات.