भाषा चुनें

Robots.txt टेस्टर और यूआरएल ब्लॉकिंग चेकर

robots.txt नियमों की जांच करें, Googlebot और AI क्रॉलर के लिए यूआरएल एक्सेस वैलिडेट करें और पार्सिंग त्रुटियां तुरंत देखें।

/robots.txt पर उपलब्ध फ़ाइल पेस्ट करें। यह आपके ब्राउज़र में जांची जाती है, कुछ भी अपलोड नहीं किया जाता।
Googlebot, GPTBot या ClaudeBot जैसा टोकन, या पूरा User-Agent स्ट्रिंग
प्रति पंक्ति एक। पूर्ण URL को पाथ और क्वेरी में छोटा कर दिया जाता है।

RFC 9309 का पालन करता है, जिसमें * वाइल्डकार्ड और $ एंड एंकर शामिल हैं: क्रॉलर का अपना ग्रुप * ग्रुप से अधिक प्राथमिकता पाता है, सबसे लंबा मैच करने वाला नियम जीतता है और टाई होने पर Allow लागू होता है। दुर्लभ मामलों में असली क्रॉलर का व्यवहार भिन्न हो सकता है।

Mehmet Demiray (मेहमत देमिराय) प्रकाशित अपडेट किया गया
साझा करें

robots.txt नियम और क्रॉलर मिलान कैसे काम करता है

वेबसाइट पर सर्च इंजन और बॉट्स के प्रवेश को नियंत्रित करने के लिए robots.txt फाइल का उपयोग किया जाता है। आधुनिक मानक RFC 9309 के अनुसार, प्रत्येक क्रॉलर फाइल को पढ़ते समय अपने लिए सबसे उपयुक्त नियम समूह चुनता है। जब कोई क्रॉलर आपकी साइट पर आता है, तो वह सबसे पहले अपने विशिष्ट नाम यानी उत्पाद टोकन (जैसे Googlebot, GPTBot या ClaudeBot) वाले समूह की तलाश करता है। यदि उसके नाम का कोई विशिष्ट समूह नहीं मिलता है, तो वह मूल टोकन (जैसे Googlebot-Image के लिए Googlebot) पर वापस जाता है। यदि ऐसा कोई समूह भी उपलब्ध नहीं है, तो वह वाइल्डकार्ड * समूह के नियमों का पालन करता है।

यहाँ यह समझना आवश्यक है कि विशिष्ट समूह सामान्य समूह को पूरी तरह बदल देता है। यदि आपने User-agent: GPTBot के लिए नियम बनाए हैं, तो वह क्रॉलर User-agent: * के तहत लिखे गए किसी भी Allow या Disallow निर्देश को नहीं पढ़ेगा। Robots.txt टेस्टर इस प्रक्रिया को सटीक रूप से अनुकरण करता है। यह आपके द्वारा दर्ज किए गए क्रॉलर टोकन के आधार पर लागू होने वाले समूह की पहचान करता है और यूआरएल के लिए सही निर्णय प्रदान करता है।

नियमों की प्राथमिकता और सबसे लंबा मिलान नियम

जब किसी एक यूआरएल पर Allow और Disallow दोनों नियम लागू हो रहे हों, तो सबसे लंबे और सबसे विशिष्ट पैटर्न वाला नियम विजयी होता है। यदि दोनों नियमों की लंबाई बिल्कुल समान हो, तो मानक के अनुसार Allow नियम को प्राथमिकता दी जाती है।

नियम प्रकार पाथ पैटर्न यूआरएल पाथ परिणाम
Disallow /blog/ /blog/post-1 ब्लॉक (लंबाई 6)
Allow /blog/post /blog/post-1 अनुमत (लंबाई 10, लंबा मिलान)
Disallow /private/ /private/ ब्लॉक (समान लंबाई पर Allow जीतता है)
Allow /private/ /private/ अनुमत

पैटर्न मिलान में दो विशेष प्रतीकों का प्रयोग व्यापक रूप से होता है:

  • * वाइल्डकार्ड: यह किसी भी वर्ण अनुक्रम से मेल खाता है, जैसे /*.pdf सभी पीडीएफ फाइलों को लक्षित करता है।
  • $ अंत एंकर: यह यूआरएल के अंत को दर्शाता है। उदाहरण के लिए /*.pdf$ केवल उन्हीं पाथ को ब्लॉक करेगा जो .pdf पर समाप्त होते हैं।

यदि फाइल में Disallow: खाली छोड़ा गया है, तो इसका अर्थ है कि उस समूह के लिए पूरी वेबसाइट खुली है। Robots.txt टेस्टर प्रत्येक यूआरएल का परीक्षण करते समय सटीक विजयी लाइन और नियम संख्या दिखाता है।

AI क्रॉलर और Content-Signal का परीक्षण

आर्टिफिशियल इंटेलिजेंस मॉडल के डेटा संग्रह को प्रबंधित करने के लिए GPTBot, ClaudeBot और Google-Extended जैसे बॉट्स के लिए विशिष्ट नियम बनाना आवश्यक हो गया है। कई प्रकाशक सर्च इंजन इंडेक्सिंग को अनुमति देते हुए केवल AI प्रशिक्षण को रोकना चाहते हैं।

आधुनिक robots.txt फाइलों में Content-Signal निर्देश का प्रयोग तेजी से बढ़ रहा है। यह निर्देश प्रकाशकों को अपनी सामग्री के उपयोग के उद्देश्य स्पष्ट करने की सुविधा देता है, जैसे कि search (सर्च परिणाम), ai-input (सर्च सारांश या RAG), और ai-train (फाउंडेशन मॉडल ट्रेनिंग)।

Robots.txt टेस्टर आपके नियमों में दिए गए इन संकेतों की पहचान करता है और आउटपुट में उनकी स्थिति रिपोर्ट करता है। यह टूल केवल इन प्राथमिकताओं को पार्स करता है और तकनीकी पहुंच की स्थिति स्पष्ट करता है। अपनी साइट के लिए AI केंद्रित नियम तैयार करने के लिए आप AI क्रॉलर robots.txt जनरेटर का उपयोग कर सकते हैं। इसके अतिरिक्त बड़ी भाषा मॉडलों को अपनी साइट की प्राथमिक सामग्री व्यवस्थित रूप से उपलब्ध कराने के लिए llms.txt जनरेटर का उपयोग भी किया जा सकता है।

robots.txt बनाते समय सामान्य गलतियाँ

robots.txt फाइल में की गई छोटी त्रुटियां पूरी वेबसाइट की विजिबिलिटी को प्रभावित कर सकती हैं। Robots.txt टेस्टर फाइल को पार्स करते समय कई सामान्य त्रुटियों को चेतावनी के रूप में चिह्नित करता है:

  1. User-agent से पहले नियम लिखना: किसी भी समूह की शुरुआत हमेशा User-agent लाइन से होनी चाहिए। इससे पहले लिखे गए Allow या Disallow नियम अमान्य माने जाते हैं।
  2. स्लैश / के बिना पाथ: सभी पाथ फॉरवर्ड स्लैश से शुरू होने चाहिए। Disallow: blog के बजाय Disallow: /blog लिखना मानक के अनुसार सही है।
  3. केस-सेंसिटिविटी की अनदेखी: यूआरएल पाथ में बड़े और छोटे अक्षरों का अंतर होता है। /Articles/ का नियम /articles/ पर लागू नहीं होगा।
  4. अप्रचलित निर्देश: Crawl-delay निर्देश RFC 9309 का हिस्सा नहीं है और Googlebot इसे अनदेखा करता है। इसी तरह Noindex को robots.txt में लिखना अब समर्थित नहीं है।

एक बड़ा भ्रम यह है कि Disallow करने से पेज गूगल से हट जाएगा। यदि किसी अन्य वेबसाइट से उस यूआरएल का लिंक मिलता है, तो गूगल बिना क्रॉल किए भी उस लिंक को सर्च में दिखा सकता है। वैध बॉट्स की पहचान सुनिश्चित करने के लिए बॉट्स पहचान कुंजी जनरेटर का उपयोग एक अतिरिक्त सुरक्षा उपाय के रूप में किया जाता है।

Robots.txt टेस्टर की कार्यप्रणाली और सीमाएं

Robots.txt टेस्टर पूरी तरह से आपके ब्राउज़र में स्थानीय रूप से काम करता है। इसका सबसे बड़ा लाभ यह है कि आपको अपने नियमों को लाइव सर्वर पर तैनात करने की आवश्यकता नहीं होती। आप विकास के चरण में ही अपनी ड्राफ्ट फाइल को पेस्ट करके विभिन्न यूआरएल के लिए जांच कर सकते हैं। कोई भी डेटा किसी बाहरी सर्वर पर नहीं भेजा जाता, जिससे अप्रकाशित प्रोजेक्ट्स की गोपनीयता बनी रहती है।

इस टूल का उपयोग करते समय कुछ सीमाओं को समझना जरूरी है:

  • यह लाइव वेबसाइट से फाइल डाउनलोड नहीं करता, आपको फाइल की सामग्री सीधे इनपुट बॉक्स में पेस्ट करनी होती है।
  • यह सर्च इंजन में पेज के इंडेक्स होने की वर्तमान स्थिति नहीं बताता, बल्कि केवल यह जांचता है कि क्रॉलर को उस पाथ को फेच करने की तकनीकी अनुमति है या नहीं।
  • दर्ज किए गए पूरे यूआरएल को स्वचालित रूप से डोमेन हटाकर पाथ और क्वेरी स्ट्रिंग में बदल दिया जाता है।

सत्यापन पूरा होने के बाद आप परिणामों को तुरंत CSV तालिका या इमेज के रूप में निर्यात कर सकते हैं, जिससे तकनीकी ऑडिट रिपोर्ट तैयार करना सरल हो जाता है।

अक्सर पूछे जाने वाले प्रश्न।

क्या इस टूल में robots.txt जाँचने के लिए किसी खाते या लाइव वेबसाइट की आवश्यकता है?

नहीं, Robots.txt टेस्टर का उपयोग करने के लिए न तो किसी खाते की ज़रूरत है और न ही वेबसाइट का लाइव होना आवश्यक है। आप अपने ड्राफ्ट कोड को सीधे यहाँ पेस्ट कर सकते हैं। यह टूल पूरी तरह आपके ब्राउज़र में काम करता है, जिससे आपकी अप्रकाशित फाइलें सुरक्षित रहती हैं।

क्या मैं जाँच के लिए पूरा वेब पता (URL) दर्ज कर सकता हूँ?

हाँ, आप पूरा URL या केवल पाथ (जैसे /products/item) दर्ज कर सकते हैं। जब आप पूरा URL डालते हैं, तो टूल डोमेन नाम को छोड़कर केवल पाथ और क्वेरी पैरामीटर की जाँच करता है, क्योंकि robots.txt के नियम डोमेन के आधार पर नहीं बल्कि पाथ के आधार पर लागू होते हैं।

जब किसी URL के लिए Allow और Disallow दोनों नियम मेल खाते हैं, तो कौन सा नियम मान्य होगा?

RFC 9309 मानकों के अनुसार सबसे लंबा और सटीक नियम जीतता है। यदि दोनों नियमों की लंबाई बिल्कुल समान हो, तो Allow नियम को Disallow पर प्राथमिकता दी जाती है। यदि कोई भी नियम मेल नहीं खाता, तो URL को क्रॉल करने की अनुमति मानी जाती है।

क्या यह टूल GPTBot और ClaudeBot जैसे AI क्रॉलर्स के नियमों की सही जाँच करता है?

हाँ, आप विशेष AI क्रॉलर्स जैसे GPTBot या ClaudeBot दर्ज करके देख सकते हैं कि वे आपकी सामग्री तक पहुँच सकते हैं या नहीं। यह टूल Content-Signal जैसे नए निर्देशों को भी पहचानता है। यदि आपको नए नियम तैयार करने हैं, तो आप एआई क्रॉलर नियम जनरेटर की मदद ले सकते हैं।

क्या robots.txt में किसी पेज को ब्लॉक करने से वह गूगल सर्च से पूरी तरह हट जाता है?

नहीं, robots.txt केवल सर्च इंजनों को पेज क्रॉल करने से रोकता है, उसे इंडेक्स होने से नहीं रोकता। यदि इंटरनेट पर किसी अन्य वेबसाइट से उस ब्लॉक किए गए पेज पर लिंक आ रहे हों, तो वह पेज सर्च परिणामों में दिख सकता है। इंडेक्सिंग रोकने के लिए पेज पर noindex मेटा टैग का प्रयोग करना चाहिए।

यदि robots.txt फाइल में किसी क्रॉलर का नाम दर्ज न हो, तो क्या नियम लागू होंगे?

जब किसी विशेष बॉट के लिए कोई अलग User-agent समूह नहीं होता, तो वह डिफ़ॉल्ट रूप से वाइल्डकार्ड वाले सामान्य नियमों का पालन करता है। यदि फाइल में सामान्य समूह भी मौजूद नहीं है, तो बॉट को साइट के सभी पेजों को क्रॉल करने की पूरी अनुमति होती है।

यह टूल Google Search Console के robots.txt टेस्टर से किस प्रकार भिन्न है?

Google Search Console में जाँच करने के लिए वेबसाइट का स्वामित्व सत्यापित करना पड़ता है और वहाँ केवल लाइव फाइल जाँची जा सकती है। इसके विपरीत, Robots.txt टेस्टर में आप वेबसाइट पर फाइल अपलोड करने से पहले ही किसी भी ड्राफ्ट को विभिन्न सर्च और AI बॉट्स के विरुद्ध तुरंत परख सकते हैं।