ভাষা নির্বাচন করুন

অনলাইন Robots.txt টেস্টার ও রুল ভ্যালিডেটর

ব্রাউজারেই robots.txt ফাইলের বৈধতা যাচাই করুন, নির্দিষ্ট ক্রলারের জন্য ইউআরএল ব্লক বা অনুমতি পরীক্ষা করুন এবং সিনট্যাক্স এরর খুঁজুন।

Robots.txt টেস্টারকীভাবে কাজ করে ↓
/robots.txt ফাইলে যেভাবে থাকে সেভাবে পেস্ট করুন। এটি আপনার ব্রাউজারেই পরীক্ষা করা হয়, কোনো ডেটা আপলোড হয় না।
Googlebot, GPTBot বা ClaudeBot-এর মতো একটি প্রোডাক্ট টোকেন, অথবা সম্পূর্ণ User-Agent স্ট্রিং
প্রতি লাইনে একটি। সম্পূর্ণ URL গুলি পাথ এবং কোয়েরি অংশে সংক্ষেপিত হয়।

RFC 9309 অনুসরণ করে, যার মধ্যে * ওয়াইল্ডকার্ড এবং $ এন্ড অ্যাঙ্কর অন্তর্ভুক্ত: ক্রলারের নিজস্ব গ্রুপ * গ্রুপের চেয়ে প্রাধান্য পায়, দীর্ঘতম ম্যাচিং নিয়মটি কার্যকর হয় এবং টাই হলে Allow অগ্রাধিকার পায়। ব্যতিক্রমী ক্ষেত্রে বাস্তব ক্রলারগুলোর আচরণ ভিন্ন হতে পারে।

Mehmet Demiray (মেহমেত দেমিরায়) প্রকাশিত আপডেট হয়েছে
শেয়ার করুন

robots.txt ফাইলের গ্রুপ নির্বাচন এবং ক্রলার মেলানোর নিয়ম

সার্চ ইঞ্জিন বট বা ওয়েব ক্রলার যখন কোনো ওয়েবসাইটে প্রবেশ করে, তখন প্রথমে robots.txt ফাইলটি পরীক্ষা করে। RFC 9309 স্ট্যান্ডার্ড অনুযায়ী এই ফাইলে বিভিন্ন নিয়মের গ্রুপ বা ব্লক সাজানো থাকে। প্রতিটি গ্রুপ এক বা একাধিক User-agent নির্দেশিকা দিয়ে শুরু হয়। ক্রলার যখন ফাইলটি পড়ে, তখন সে নিজের নামের সাথে সবচেয়ে নিখুঁতভাবে মিলে যাওয়া গ্রুপটি বেছে নেয়।

উদাহরণস্বরূপ, কোনো ক্রলারের নাম Googlebot হলে সে প্রথমে নিজের নামের জন্য নির্ধারিত নির্দিষ্ট গ্রুপটি খুঁজে দেখে। যদি নির্দিষ্ট গ্রুপ থাকে, তবে সে কেবল সেই গ্রুপের নিয়মগুলোই অনুসরণ করবে এবং সাধারণ User-agent: গ্রুপের সব নিয়ম সম্পূর্ণ উপেক্ষা করবে। নির্দিষ্ট গ্রুপটি সাধারণ নিয়মগুলোর সাথে যোগ হয় না, বরং সেগুলোকে প্রতিস্থাপন করে। যদি নির্দিষ্ট গ্রুপ না থাকে, তবে হাইফেনযুক্ত নামের ক্ষেত্রে প্যারেন্ট টোকেন (যেমন Googlebot-Image এর ক্ষেত্রে Googlebot) খোঁজা হয়। সেটিও না থাকলে ক্রলার User-agent: গ্রুপে ফিরে যায়। যদি কোনো গ্রুপই না মিলে, তবে কোনো বিধিনিষেধ প্রযোজ্য হয় না এবং ক্রলার সম্পূর্ণ সাইট অ্যাক্সেস করতে পারে। Robots.txt টেস্টার এই বাছাই প্রক্রিয়াটি নিখুঁতভাবে সিমুলেট করে কার্যকর গ্রুপ ও ফলাফল উপস্থাপন করে।

দীর্ঘতম নিয়মের অগ্রাধিকার এবং ওয়াইল্ডকার্ড প্যাটার্ন

যখন একটি নির্দিষ্ট ইউআরএল একই সাথে Allow এবং Disallow নিয়মের আওতায় পড়ে, তখন দীর্ঘতম অক্ষরের প্যাটার্নযুক্ত নিয়মটি জয়ী হয়। একে দীর্ঘতম ম্যাচ নীতি বলা হয়। স্ট্রিংয়ের দৈর্ঘ্য অনুযায়ী যে নিয়মের পাথ সবচেয়ে বিস্তারিত, ক্রলার সেই নিয়মটিকেই চূড়ান্ত নির্দেশ হিসেবে গ্রহণ করে।

যদি Allow এবং Disallow উভয় নিয়মের পাথ দৈর্ঘ্যে সমান হয়, তবে স্ট্যান্ডার্ড অনুযায়ী Allow নিয়মটি অগ্রাধিকার পায়। এছাড়া ফাঁকা Disallow: লাইনের অর্থ হলো ক্রলিংয়ের পূর্ণ অনুমতি প্রদান করা।

| নিয়ম নির্দেশিকা | পরীক্ষিত ইউআরএল | ফলাফল | কার্যকর কারণ | | Disallow: /bangla/ | /bangla/post | ব্লক | পাথের মিল পাওয়া গেছে | | Allow: /bangla/post | /bangla/post | অনুমোদিত | দীর্ঘতম প্যাটার্ন জয়ী | | Disallow: /*.pdf$ | /file.pdf | ব্লক | $ দিয়ে ইউআরএল সমাপ্তি চিহ্নিত |

এখানে * প্রতীক যেকোনো অক্ষরের সাথে মেলে এবং $ প্রতীক ইউআরএলের সমাপ্তি নিশ্চিত করে। Robots.txt টেস্টার এই নিয়মগুলো বিস্তারিত বিশ্লেষণ করে প্রতিটি ইউআরএলের জন্য কোন লাইনটি কার্যকর হলো তা লাইন নম্বরসহ দেখিয়ে দেয়।

এআই ক্রলার নিয়ন্ত্রণ এবং কনটেন্ট সিগন্যাল যাচাই

আধুনিক কৃত্রিম বুদ্ধিমত্তা মডেল চালিত বট যেমন GPTBot, ClaudeBot কিংবা Google-Extended প্রতিনিয়ত ওয়েব কনটেন্ট সংগ্রহ করছে। এই বটগুলো সাধারণ সার্চ ইঞ্জিনের মতো শুধু ইনডেক্স করে না, বরং এআই মডেলের প্রশিক্ষণের জন্য ডেটা সংগ্রহ করে। তাই সাইট মালিকদের জন্য এই বটগুলোর অ্যাক্সেস আলাদাভাবে নিয়ন্ত্রণ করা গুরুত্বপূর্ণ।

ওয়েবসাইটের robots.txt ফাইলে Content-Signal নামের একটি নতুন নির্দেশিকাও ব্যবহৃত হচ্ছে। এর মাধ্যমে কনটেন্ট ব্যবহারের অনুমোদন যেমন search, ai-input বা ai-train সরাসরি ঘোষণা করা যায়। এটি প্রযুক্তিগতভাবে নেটওয়ার্ক রিকোয়েস্ট ব্লক করে না, বরং মেশিন রিডেবল নীতি প্রকাশ করে। সঠিক নিয়ম লেখার জন্য এআই ক্রলার robots.txt জেনারেটর ব্যবহার করা যেতে পারে এবং এআই সিস্টেমের উপযোগী ডকুমেন্ট কাঠামোর জন্য llms.txt জেনারেটর সাহায্য করে। Robots.txt টেস্টার এই সমস্ত বট টোকেন এবং সিগন্যাল শনাক্ত করে প্রতিটি বটের জন্য নির্ধারিত অ্যাক্সেস রিপোর্ট তৈরি করে।

robots.txt ফাইলে সাধারণ ভুল ও পার্সার সতর্কতা

robots.txt ফাইল লেখার সময় অসাবধানতাবশত ভুল হলে তা সম্পূর্ণ সাইটের ট্রাফিকের ক্ষতি করতে পারে। একটি বহুল প্রচলিত ভুল হলো কোনো User-agent উল্লেখ করার আগেই Allow বা Disallow নিয়ম লিখে ফেলা। RFC 9309 অনুযায়ী এমন নিয়ম ক্রলার পুরোপুরি বাতিল করে দেয়।

আরেকটি সাধারণ ভুল হলো পাথের শুরুতে স্ল্যাশ (/) বাদ দেওয়া। যেমন Disallow: private লিখলে তা ভুল সিনট্যাক্স হিসেবে গণ্য হয়, সঠিক রূপ হলো Disallow: /private। অনেকে সার্চ রেজাল্ট থেকে পেজ সরাতে এই ফাইলে Noindex লিখে রাখেন, যা গুগল এবং অন্যান্য আধুনিক ক্রলার সমর্থন করে না। ক্রলিং আটকানো এবং ইনডেক্সিং আটকানো সম্পূর্ণ ভিন্ন বিষয়। কোনো পেজ ক্রলিং থেকে ব্লক করা থাকলেও বাহ্যিক লিঙ্কের মাধ্যমে তা সার্চ ইঞ্জিনে ইনডেক্স হতে পারে। এছাড়া Crawl-delay নির্দেশিকাটিও গুগল উপেক্ষা করে। Robots.txt টেস্টার ফাইলে থাকা এই ধরণের অকার্যকর বা ভুল লাইনগুলো চিহ্নিত করে পার্সার সতর্কতা হিসেবে তুলে ধরে।

ব্রাউজারভিত্তিক টেস্টারের সুবিধা এবং প্রযুক্তিগত পরিসীমা

Robots.txt টেস্টার সম্পূর্ণভাবে ব্রাউজারের মধ্যে স্থানীয়ভাবে চলে। ফলে কোনো লাইভ সার্ভারে ফাইল আপলোড না করেই বা অ্যাকাউন্ট তৈরি না করেই খসড়া ফাইল পরীক্ষা করা সম্ভব হয়। এতে অপ্রকাশিত ওয়েব স্ট্রাকচার বা ডেভেলপমেন্ট সাইটের গোপনীয়তা শতভাগ সুরক্ষিত থাকে।

তবে এই টুলের প্রযুক্তিগত পরিসীমা সম্পর্কে স্পষ্ট ধারণা থাকা প্রয়োজন। এটি কোনো লাইভ সাইট থেকে ফাইল ফেচ করে না এবং গুগল সার্চ কনসোলের মতো লাইভ ইনডেক্সিং স্ট্যাটাস প্রদান করে না। এটি শুধুমাত্র প্রদত্ত ফাইলের টেক্সট ও স্ট্যান্ডার্ড পার্সিং রুলস অনুকরণ করে। এছাড়া কোনো বট ভুয়া User-Agent ব্যবহার করলে তা robots.txt দিয়ে যাচাই করা সম্ভব নয়; সেজন্য ওয়েব বট কি যাচাইকরণ টুল ব্যবহারের মাধ্যমে সার্ভার স্তরে সত্যতা যাচাই করতে হয়। এই টেস্টারটি কোড প্রকাশের আগেই সমস্ত নিয়ম নিখুঁতভাবে পরীক্ষা করার একটি দ্রুত মাধ্যম।

যেগুলোর উত্তর আমরা সবচেয়ে বেশি দিই।

কোনো ইউআরএল রোবট দিয়ে ব্লক করা আছে কি না কীভাবে পরীক্ষা করবেন?

আপনার robots.txt ফাইলের টেক্সট কপি করে এই টেস্টারে পেস্ট করুন। এরপর ক্রলারের নাম (যেমন Googlebot বা GPTBot) নির্বাচন করুন এবং যে পাথ বা লিঙ্ক যাচাই করতে চান তা লিখুন। Robots.txt টেস্টার সাথে সাথে প্রতিটি ইউআরএলের জন্য অনুমোদিত (Allowed) নাকি নিষিদ্ধ (Blocked) ফলাফল এবং কোন নিয়মের কারণে এমনটি হয়েছে তা লাইন নম্বরসহ দেখিয়ে দেবে।

একই পাথের জন্য Allow এবং Disallow উভয় নির্দেশ থাকলে কোনটি কাজ করবে?

robots.txt-এর আধুনিক নিয়ম (RFC 9309) অনুযায়ী সবচেয়ে দীর্ঘ এবং নির্দিষ্ট প্যাটার্নটি কার্যকর হয়। উদাহরণস্বরূপ /blog/seo যদি Allow থাকে এবং /blog/ যদি Disallow থাকে, তবে দীর্ঘতম মিলের জন্য /blog/seo অনুমোদিত হবে। যদি দুটি নিয়মের অক্ষরের দৈর্ঘ্য সমান হয়, তবে Allow নির্দেশ অগ্রাধিকার পায়।

এই টুল ব্যবহারের জন্য কি ওয়েবসাইট লাইভ থাকা বা অ্যাকাউন্ট খোলা বাধ্যতামূলক?

কোনো অ্যাকাউন্ট বা লাইভ ওয়েবসাইটের প্রয়োজন নেই। আপনার ব্রাউজারের মধ্যেই সম্পূর্ণ পরীক্ষা সম্পন্ন হয়, তাই অপ্রকাশিত ড্রাফট ফাইলও নিরাপদে পরীক্ষা করতে পারবেন। নতুন নিয়মের খসড়া তৈরি করতে চাইলে আপনি এআই ক্রলারের জন্য robots.txt তৈরির টুল ব্যবহার করে তৈরি করা কোড সরাসরি এখানে পরীক্ষা করতে পারেন।

robots.txt দিয়ে কোনো পৃষ্ঠা Disallow করলে কি তা সার্চ ইঞ্জিন থেকে মুছে যাবে?

না, robots.txt কেবল বট বা ক্রলারকে সাইটের পৃষ্ঠা ডাউনলোড করা থেকে বিরত রাখে। ইন্টারনেটের অন্য কোনো সাইট থেকে ওই পৃষ্ঠার লিঙ্ক থাকলে গুগল ক্রল না করেই শুধু ইউআরএল ইনডেক্স করে সার্চ ফলাফলে দেখাতে পারে। সার্চ ফলাফল থেকে কোনো পৃষ্ঠা সম্পূর্ণ বাদ দিতে মেটা ট্যাগে noindex বা সার্ভার হেডার ব্যবহার করা প্রয়োজন।

Content-Signal নির্দেশিকা কী এবং এই টুল এটি কীভাবে মূল্যায়ন করে?

কৃত্রিম বুদ্ধিমত্তা বা AI মডেলকে কনটেন্ট প্রশিক্ষণ ও ব্যবহারের অনুমতি নির্দিষ্ট করতে Content-Signal ব্যবহৃত হয়। Robots.txt টেস্টার আপনার ফাইলে থাকা এই সিগন্যালগুলো শনাক্ত করে প্রদর্শন করে। তবে এটি কোনো প্রযুক্তিগত ব্লকিং নিয়ম নয়, বরং ক্রলারদের জন্য একটি নির্দেশনামূলক তথ্য। এআই কনটেন্ট ব্যবস্থাপনার জন্য llms.txt জেনারেটর ব্যবহার করতে পারেন।

কোনো নির্দিষ্ট বট বা ক্রলারের নাম ফাইলে উল্লেখ না থাকলে কী ঘটবে?

যদি ফাইলে নির্দিষ্ট কোনো ক্রলারের আলাদা গ্রুপ না থাকে, তবে ক্রলারটি সাধারণ User-agent: * গ্রুপের নিয়ম অনুসরণ করবে। ফাইলে কোনো সাধারণ তারকাচিহ্নযুক্ত গ্রুপও যদি উপস্থিত না থাকে, তবে ক্রলারটি ধরে নেবে যে সমস্ত ইউআরএল ক্রল করার অনুমতি রয়েছে।

গুগল সার্চ কনসোলের রিপোর্টের তুলনায় এই টেস্টিং টুলের সুবিধা কী?

সার্চ কনসোল কেবল ইন্টারনেটে লাইভ থাকা ফাইল এবং গুগলবটের ফলাফল যাচাই করে। অন্যদিকে Robots.txt টেস্টার ব্যবহার করে সাইটে আপলোড করার আগেই যেকোনো খসড়া নিয়ম পরীক্ষা করা যায়। পাশাপাশি Googlebot ছাড়াও GPTBot বা ClaudeBot সহ বিভিন্ন কৃত্রিম বুদ্ধিমত্তা বটের প্রতিক্রিয়া তাত্ক্ষণিকভাবে দেখা সম্ভব।