robots.txt नियम और क्रॉलर मिलान कैसे काम करता है
वेबसाइट पर सर्च इंजन और बॉट्स के प्रवेश को नियंत्रित करने के लिए robots.txt फाइल का उपयोग किया जाता है। आधुनिक मानक RFC 9309 के अनुसार, प्रत्येक क्रॉलर फाइल को पढ़ते समय अपने लिए सबसे उपयुक्त नियम समूह चुनता है। जब कोई क्रॉलर आपकी साइट पर आता है, तो वह सबसे पहले अपने विशिष्ट नाम यानी उत्पाद टोकन (जैसे Googlebot, GPTBot या ClaudeBot) वाले समूह की तलाश करता है। यदि उसके नाम का कोई विशिष्ट समूह नहीं मिलता है, तो वह मूल टोकन (जैसे Googlebot-Image के लिए Googlebot) पर वापस जाता है। यदि ऐसा कोई समूह भी उपलब्ध नहीं है, तो वह वाइल्डकार्ड * समूह के नियमों का पालन करता है।
यहाँ यह समझना आवश्यक है कि विशिष्ट समूह सामान्य समूह को पूरी तरह बदल देता है। यदि आपने User-agent: GPTBot के लिए नियम बनाए हैं, तो वह क्रॉलर User-agent: * के तहत लिखे गए किसी भी Allow या Disallow निर्देश को नहीं पढ़ेगा। Robots.txt टेस्टर इस प्रक्रिया को सटीक रूप से अनुकरण करता है। यह आपके द्वारा दर्ज किए गए क्रॉलर टोकन के आधार पर लागू होने वाले समूह की पहचान करता है और यूआरएल के लिए सही निर्णय प्रदान करता है।
नियमों की प्राथमिकता और सबसे लंबा मिलान नियम
जब किसी एक यूआरएल पर Allow और Disallow दोनों नियम लागू हो रहे हों, तो सबसे लंबे और सबसे विशिष्ट पैटर्न वाला नियम विजयी होता है। यदि दोनों नियमों की लंबाई बिल्कुल समान हो, तो मानक के अनुसार Allow नियम को प्राथमिकता दी जाती है।
| नियम प्रकार |
पाथ पैटर्न |
यूआरएल पाथ |
परिणाम |
| Disallow |
/blog/ |
/blog/post-1 |
ब्लॉक (लंबाई 6) |
| Allow |
/blog/post |
/blog/post-1 |
अनुमत (लंबाई 10, लंबा मिलान) |
| Disallow |
/private/ |
/private/ |
ब्लॉक (समान लंबाई पर Allow जीतता है) |
| Allow |
/private/ |
/private/ |
अनुमत |
पैटर्न मिलान में दो विशेष प्रतीकों का प्रयोग व्यापक रूप से होता है:
* वाइल्डकार्ड: यह किसी भी वर्ण अनुक्रम से मेल खाता है, जैसे /*.pdf सभी पीडीएफ फाइलों को लक्षित करता है।
$ अंत एंकर: यह यूआरएल के अंत को दर्शाता है। उदाहरण के लिए /*.pdf$ केवल उन्हीं पाथ को ब्लॉक करेगा जो .pdf पर समाप्त होते हैं।
यदि फाइल में Disallow: खाली छोड़ा गया है, तो इसका अर्थ है कि उस समूह के लिए पूरी वेबसाइट खुली है। Robots.txt टेस्टर प्रत्येक यूआरएल का परीक्षण करते समय सटीक विजयी लाइन और नियम संख्या दिखाता है।
AI क्रॉलर और Content-Signal का परीक्षण
आर्टिफिशियल इंटेलिजेंस मॉडल के डेटा संग्रह को प्रबंधित करने के लिए GPTBot, ClaudeBot और Google-Extended जैसे बॉट्स के लिए विशिष्ट नियम बनाना आवश्यक हो गया है। कई प्रकाशक सर्च इंजन इंडेक्सिंग को अनुमति देते हुए केवल AI प्रशिक्षण को रोकना चाहते हैं।
आधुनिक robots.txt फाइलों में Content-Signal निर्देश का प्रयोग तेजी से बढ़ रहा है। यह निर्देश प्रकाशकों को अपनी सामग्री के उपयोग के उद्देश्य स्पष्ट करने की सुविधा देता है, जैसे कि search (सर्च परिणाम), ai-input (सर्च सारांश या RAG), और ai-train (फाउंडेशन मॉडल ट्रेनिंग)।
Robots.txt टेस्टर आपके नियमों में दिए गए इन संकेतों की पहचान करता है और आउटपुट में उनकी स्थिति रिपोर्ट करता है। यह टूल केवल इन प्राथमिकताओं को पार्स करता है और तकनीकी पहुंच की स्थिति स्पष्ट करता है। अपनी साइट के लिए AI केंद्रित नियम तैयार करने के लिए आप AI क्रॉलर robots.txt जनरेटर का उपयोग कर सकते हैं। इसके अतिरिक्त बड़ी भाषा मॉडलों को अपनी साइट की प्राथमिक सामग्री व्यवस्थित रूप से उपलब्ध कराने के लिए llms.txt जनरेटर का उपयोग भी किया जा सकता है।
Robots.txt टेस्टर की कार्यप्रणाली और सीमाएं
Robots.txt टेस्टर पूरी तरह से आपके ब्राउज़र में स्थानीय रूप से काम करता है। इसका सबसे बड़ा लाभ यह है कि आपको अपने नियमों को लाइव सर्वर पर तैनात करने की आवश्यकता नहीं होती। आप विकास के चरण में ही अपनी ड्राफ्ट फाइल को पेस्ट करके विभिन्न यूआरएल के लिए जांच कर सकते हैं। कोई भी डेटा किसी बाहरी सर्वर पर नहीं भेजा जाता, जिससे अप्रकाशित प्रोजेक्ट्स की गोपनीयता बनी रहती है।
इस टूल का उपयोग करते समय कुछ सीमाओं को समझना जरूरी है:
- यह लाइव वेबसाइट से फाइल डाउनलोड नहीं करता, आपको फाइल की सामग्री सीधे इनपुट बॉक्स में पेस्ट करनी होती है।
- यह सर्च इंजन में पेज के इंडेक्स होने की वर्तमान स्थिति नहीं बताता, बल्कि केवल यह जांचता है कि क्रॉलर को उस पाथ को फेच करने की तकनीकी अनुमति है या नहीं।
- दर्ज किए गए पूरे यूआरएल को स्वचालित रूप से डोमेन हटाकर पाथ और क्वेरी स्ट्रिंग में बदल दिया जाता है।
सत्यापन पूरा होने के बाद आप परिणामों को तुरंत CSV तालिका या इमेज के रूप में निर्यात कर सकते हैं, जिससे तकनीकी ऑडिट रिपोर्ट तैयार करना सरल हो जाता है।