ভাষা নির্বাচন করুন

এআই ক্রলারের জন্য robots.txt ফাইল তৈরি করুন

বিভিন্ন এআই বট ব্লক করুন, কন্টেন্ট সিগন্যাল পলিসি সেট করুন এবং কাস্টম robots.txt ফাইল সহজেই ব্রাউজারে তৈরি করে ডাউনলোড করুন।

এআই robots.txt জেনারেটরকীভাবে কাজ করে ↓
পৃষ্ঠাটি ইনডেক্স করুন এবং সংক্ষিপ্ত অংশসহ লিংক দেখান
জেনারেট করা উত্তরের উৎস উপাদান হিসেবে পৃষ্ঠাটি ব্যবহার করুন
AI মডেল প্রশিক্ষণ বা ফাইন-টিউন করতে পৃষ্ঠাটি ব্যবহার করুন
Cloudflare এক্সটেনশন: সংগৃহীত বিষয়বস্তু নিয়ে বট কত দূর যেতে পারে
আইনি ভাষা যা ইইউ কপিরাইট নিয়মের অধীনে সংকেতগুলোকে কার্যকর করে
এগুলো ব্লক করলে সার্চ ইঞ্জিনে উপস্থিতির ওপর কোনো প্রভাব পড়ে না
এগুলো ব্লক করলে AI অনুসন্ধান উত্তর ও সাইটেশন থেকে আপনার পৃষ্ঠা বাদ পড়বে
এগুলো ব্লক করলে অনুরোধের ভিত্তিতে সহকারীদের আপনার পৃষ্ঠা খোলা বন্ধ হবে
ব্যবহারকারীর পক্ষে ক্লিক ও ফর্ম পূরণকারী এজেন্ট
সম্পূর্ণ সাইটের জন্য / বা /articles/ এর মতো ফোল্ডার ব্যবহার করুন
শুধুমাত্র Sitemap এবং llms.txt নির্দেশনার জন্য প্রয়োজন
মন্তব্য হিসেবে যোগ করা হয়েছে; robots.txt-এ কোনো llms.txt নির্দেশনা নেই

robots.txt এবং Content-Signal শুধুমাত্র পছন্দ নির্দেশ করে; তারা নিজে থেকে কিছুই ব্লক করে না। নিয়ম মেনে চলা ক্রলারগুলো এগুলো মান্য করে, অন্যরা উপেক্ষা করে এবং গুগল জানিয়েছে যে তারা Content-Signal অনুযায়ী কাজ করে না। কঠোরভাবে প্রয়োগ করতে সার্ভার-স্তরের বট নিয়ম ব্যবহার করুন।

Mehmet Demiray (মেহমেত দেমিরায়) প্রকাশিত আপডেট হয়েছে
শেয়ার করুন

চার ধরনের এআই বট এবং তাদের কাজের ধরন

ইন্টারনেটে সক্রিয় কৃত্রিম বুদ্ধিমত্তা বা এআই বটগুলোকে প্রধানত চারটি ভাগে ভাগ করা যায়। প্রতিটি বটের উদ্দেশ্য এবং কাজের ধরণ আলাদা, তাই কোনো বট ব্লক করার আগে সেটির প্রভাব জানা জরুরি।

প্রথম ভাগে রয়েছে প্রশিক্ষণ ডেটা সংগ্রহকারী বট বা ট্রেনিং ক্রলার। GPTBot, ClaudeBot, Google-Extended এবং CCBot এর অন্তর্ভুক্ত। এই বটগুলো ওয়েবসাইটের কনটেন্ট সংগ্রহ করে বড় ভাষা মডেল বা এলএলএম প্রশিক্ষণে ব্যবহার করে। এগুলোকে ব্লক করলে এআই মডেলে আপনার লেখা সরাসরি অন্তর্ভুক্ত হওয়া বন্ধ হয়।

দ্বিতীয় ভাগে রয়েছে এআই সার্চ ইনডেক্সার, যেমন OAI-SearchBot কিংবা PerplexityBot। এগুলো বিভিন্ন এআই সার্চ ইঞ্জিনের উত্তর তৈরির জন্য রিয়েল-টাইম তথ্য ইনডেক্স করে। এগুলো ব্লক করলে এআই সার্চ ফলাফলে আপনার সাইটের সূত্র বা রেফারেন্স আসা বন্ধ হয়ে যেতে পারে।

তৃতীয় ভাগে রয়েছে ব্যবহারকারী পরিচালিত ফেচার বট। যেমন কোনো চ্যাটজিপিটি ব্যবহারকারী যখন নির্দিষ্ট কোনো ওয়েবসাইটের লিঙ্ক দিয়ে সারাংশ জানতে চান, তখন ChatGPT-User বটটি সেই পাতাটি পড়ে দেখে।

চতুর্থ ভাগে রয়েছে ব্রাউজিং এজেন্ট, যা বিভিন্ন স্বয়ংক্রিয় কাজের জন্য ওয়েব ব্রাউজ করে।

এআই robots.txt জেনারেটর ব্যবহার করে আপনি সহজেই সিদ্ধান্ত নিতে পারেন কোন শ্রেণীর বটকে অনুমতি দেবেন এবং কাদের আটকে দেবেন।

জেনারেট করা robots.txt ফাইল যেভাবে কাজ করে

একটি সুগঠিত robots.txt ফাইলে মূলত দুটি স্তরে নির্দেশনা তৈরি করা হয়। প্রথম স্তরে সার্বজনীন রুল বা User-agent: * ব্লকে কনটেন্ট সিগন্যাল ও সাধারণ ব্রাউজিং অনুমতি থাকে। দ্বিতীয় স্তরে প্রতিটি নির্দিষ্ট এআই বটের জন্য আলাদা Disallow গ্রুপ তৈরি করা হয়।

ফাইলের মূল কাঠামোতে প্রতিটি বটের নাম এবং পাথ সুনির্দিষ্টভাবে উল্লেখ থাকে। নিচে সাধারণ উদাহরণের বিন্যাস দেখানো হলো:

নির্দেশনা ফিল্ড ভ্যালু কাজের বিবরণ
User-agent * সকল সাধারণ ক্রলারের জন্য প্রযোজ্য
Content-Signal search=yes, ai-train=no কনটেন্ট ব্যবহারের সুনির্দিষ্ট নীতিমালা
Allow / ওয়েবসাইটের সাধারণ ভিজিটরদের জন্য উন্মুক্ত
User-agent GPTBot নির্দিষ্ট এআই প্রশিক্ষণ বট
Disallow / সম্পূর্ণ ওয়েবসাইট পড়া থেকে বিরত রাখার অনুরোধ

এর পাশাপাশি ফাইলে সাইটম্যাপের ঠিকানা নির্দেশ করতে Sitemap: লাইন এবং এআই তথ্যের জন্য llms.txt ফাইলের কমেন্ট যুক্ত করার অপশন থাকে। এআই robots.txt জেনারেটর এই সম্পূর্ণ ফাইলটি সরাসরি ব্রাউজারে তৈরি করে, ফলে কোনো তথ্য অন্য কোনো সার্ভারে যায় না।

কনটেন্ট সিগন্যাল বা Content-Signal নীতিমালার ভূমিকা

ঐতিহ্যবাহী Disallow নির্দেশনার বাইরে কনটেন্ট সিগন্যাল হলো এমন একটি মানসম্মত প্রোটোকল, যার মাধ্যমে ক্রলারকে জানানো যায় ওয়েবসাইটের তথ্য কোন কাজে ব্যবহার করা যাবে। এতে মূলত তিনটি প্রধান সিগন্যাল থাকে: search, ai-input, এবং ai-train।

search নির্ধারণ করে এআই সার্চ ইঞ্জিনে আপনার কনটেন্ট উদ্ধৃত হতে পারবে কি না। ai-input নির্দেশ করে ব্যবহারকারীর তাৎক্ষণিক প্রম্পটের উত্তরে তথ্য ব্যবহৃত হতে পারবে কি না। ai-train নির্দেশ করে দীর্ঘমেয়াদী মডেল প্রশিক্ষণে ডেটা ব্যবহার করা যাবে কি না। প্রতিটি সিগন্যালে yes, no, অথবা কোনো পছন্দ প্রকাশ না করার সুবিধা রয়েছে।

ক্লাউডফ্লেয়ারের মতো সেবাদাতারা এর সাথে use প্যারামিটার সমর্থন করে, যার মাধ্যমে ব্যবহারের মাত্রা নির্দিষ্ট করা যায়। এছাড়াও ফাইলে ইউরোপীয় ইউনিয়নের কপিরাইট নির্দেশিকার অনুচ্ছেদ ৪ অনুযায়ী টেক্সট ও ডেটা মাইনিং অধিকার সংরক্ষণের ঘোষণামূলক কমেন্ট যুক্ত করার ব্যবস্থা রাখা হয়েছে। এটি কনটেন্ট নির্মাতাদের মেধা সম্পত্তির ওপর নিয়ন্ত্রণ বজায় রাখতে আইনি ভিত্তি দেয়।

ওয়েবসাইটের প্রয়োজন অনুযায়ী সঠিক ব্লকিং কৌশল নির্বাচন

সব ওয়েবসাইটের চাহিদা এক নয়। তাই এআই robots.txt জেনারেটর চারটি ভিন্ন প্রিসেট সমর্থন করে যাতে প্রত্যেকে তাদের কৌশল অনুযায়ী ফাইল তৈরি করতে পারেন।

  1. শুধুমাত্র প্রশিক্ষণ ক্রলার ব্লক: এটি ডিফল্ট এবং সবচেয়ে ভারসাম্যপূর্ণ পছন্দ। এতে GPTBot বা ClaudeBot এর মতো ২৫ এর বেশি ট্রেনিং বট ব্লক হয়, কিন্তু এআই সার্চ বটগুলো সচল থাকে। ফলে এআই উত্তরে সাইটের ট্রাফিক আসার সুযোগ থাকে।
  2. সকল এআই ক্রলার ব্লক: যেসব প্রকাশক তাদের কোনো কনটেন্টই এআই প্ল্যাটফর্মে দেখতে চান না, তারা এই প্রিসেট বেছে নিতে পারেন। এতে ৫০ টির বেশি এআই ইউজার-এজেন্ট সম্পূর্ণ ব্লক হয়ে যায়।
  3. শুধুমাত্র কনটেন্ট সিগন্যাল: এতে কোনো বটকে সরাসরি Disallow না করে শুধুমাত্র নীতিমালার মাধ্যমে ব্যবহারের উদ্দেশ্য পরিষ্কার করা হয়।
  4. কাস্টম পছন্দ: নির্দিষ্ট কোনো ডিরেক্টরি যেমন /drafts/ বা /archive/ আলাদা করে সুরক্ষিত করার জন্য এই মোড ব্যবহার করা যায়।

robots.txt এর সীমাবদ্ধতা এবং নিরাপত্তা নিশ্চিতকরণ

robots.txt ফাইলের নির্দেশনা মূলত একটি প্রযুক্তিগত অনুরোধ, কোনো অলঙ্ঘনীয় দেয়াল নয়। দায়িত্বশীল এআই প্রতিষ্ঠানগুলো এই ফাইল মেনে চলে, কিন্তু অননুমোদিত স্ক্র্যাপার বা অসাধু বট এই নিয়ম উপেক্ষা করতে পারে।

দ্বিতীয়ত, একবার যেসব কনটেন্ট পুরনো মডেলগুলোতে প্রশিক্ষণ দিয়ে সংগ্রহ করে ফেলা হয়েছে, robots.txt আপডেট করলে সেগুলো স্বয়ংক্রিয়ভাবে মুছে যায় না। এটি কেবল ভবিষ্যৎ ক্রলিং রোধ করে। তাই সম্পূর্ণ নিরাপত্তার জন্য সার্ভার-লেভেল বা সিডিএন ফায়ারওয়াল রুল ব্যবহার করা কার্যকর উপায়। প্রয়োজনে বট অথেন্টিকেশন কি জেনারেটর ব্যবহার করে অনুমোদিত বট যাচাই করা যায়।

জেনারেট করা ফাইলটি সার্ভারের মূল রুটে আপলোড করার পর কনফিগারেশন ঠিক আছে কি না তা robots.txt টেস্ট করার টুল দিয়ে পরীক্ষা করে নেওয়া উচিত। এতে সার্চ ইঞ্জিনের সূচিকরণে কোনো ভুল ব্লক তৈরি হয়েছে কি না তা সহজেই ধরা পড়ে।

robots.txt এবং llms.txt ফাইলের পারস্পরিক সম্পর্ক

ওয়েবসাইট পরিচালনার ক্ষেত্রে robots.txt এবং llms.txt দুটি সম্পূর্ণ ভিন্ন উদ্দেশ্যে কাজ করে। robots.txt নিয়ন্ত্রণ করে কে আপনার সাইটের কোন পাতা ক্রল করতে পারবে বা পারবে না। অন্যদিকে llms.txt তৈরি করা হয় এআই মডেলগুলোর পড়ার উপযোগী সংক্ষিপ্ত টেক্সট ফরম্যাটে ওয়েবসাইটের সারসংক্ষেপ তুলে ধরার জন্য।

যেহেতু robots.txt স্পেসিফিকেশনে সরাসরি llms.txt নির্দেশ করার কোনো আনুষ্ঠানিক ডিরেক্টিভ নেই, তাই এআই robots.txt জেনারেটর এটিকে একটি কমেন্ট বা মন্তব্য হিসেবে অন্তর্ভুক্ত করে। এর ফলে যেসব বট কমেন্ট পার্স করে, তারা সহজেই আপনার সাইটের মূল এআই নথির সন্ধান পায়।

আপনি যদি সাইটের জন্য কার্যকর এলএলএম ফাইল তৈরি করতে চান, তবে আলাদাভাবে llms.txt জেনারেটর টুল ব্যবহার করে ফাইলটি প্রস্তুত করে নিতে পারেন। এই দুটি ফাইলের সঠিক সমন্বয় একদিকে অনাকাঙ্ক্ষিত স্ক্র্যাপিং ঠেকায়, অন্যদিকে বৈধ এআই উত্তরগুলোতে সাইটের তথ্য নিখুঁতভাবে উপস্থাপনে সাহায্য করে।

যেগুলোর উত্তর আমরা সবচেয়ে বেশি দিই।

এআই বট ব্লক করার জন্য তৈরি করা robots.txt ফাইলটি ওয়েবসাইটে কোথায় রাখতে হবে?

ফাইলটি জেনারেট করার পর ডাউনলোড করে আপনার ওয়েবসাইটের রুট ডিরেক্টরিতে আপলোড করতে হবে। ফাইলটির সঠিক ইউআরএল yourdomain.com/robots.txt হতে হবে। কোনো সাবফোল্ডারে রাখলে সার্চ ইঞ্জিন বা এআই ক্রলাররা এই নিয়মগুলো দেখতে পাবে না।

এআই ক্রলার ব্লক করলে কি গুগলের সাধারণ সার্চ র‍্যাঙ্কিংয়ে কোনো ক্ষতি হবে?

না, সাধারণ সার্চ ফলাফলে কোনো ক্ষতি হবে না। গুগল সার্চ ইনডেক্স করার জন্য Googlebot ব্যবহার করে, অন্যদিকে জেমিনি এআই মডেল প্রশিক্ষণে Google-Extended ব্যবহার করা হয়। আপনি Google-Extended ব্লক করলে সাইটের কনটেন্ট দিয়ে এআই ট্রেনিং বন্ধ থাকবে কিন্তু নিয়মিত সার্চ ট্রাফিকে কোনো প্রভাব পড়বে না।

GPTBot, OAI-SearchBot এবং ChatGPT-User এর মধ্যে মূল পার্থক্য কী?

GPTBot মূলত ওপেনএআই-এর মডেল প্রশিক্ষণের জন্য বড় পরিসরে ডেটা সংগ্রহ করে। OAI-SearchBot এআই সার্চ রেজাল্টে ওয়েবসাইটের তথ্য ও লিংক রেফারেন্স হিসেবে দেখানোর জন্য কাজ করে। আর ChatGPT-User তখনই আপনার সাইটে আসে যখন কোনো ব্যবহারকারী সরাসরি চ্যাটে আপনার সাইটের নির্দিষ্ট কোনো লিংক দেখার অনুরোধ করেন।

Content-Signal কী এবং এটি কেন robots.txt ফাইলে রাখা হয়?

Content-Signal হলো একটি আধুনিক পলিসি প্রোটোকল যার মাধ্যমে ওয়েবসাইটের কনটেন্ট কোন উদ্দেশ্যে ব্যবহার করা যাবে তা সংজ্ঞায়িত করা যায়। এর মাধ্যমে search, ai-input এবং ai-train টোকেন দিয়ে সার্চে উদ্ধৃতি দেওয়া কিংবা এআই প্রশিক্ষণের অনুমতি আলাদাভাবে নিয়ন্ত্রণ করা সম্ভব হয়।

robots.txt কি সব ধরনের এআই স্ক্র্যাপিং পুরোপুরি বন্ধ করতে পারে?

robots.txt হলো একটি নির্দেশনামূলক প্রটোকল, কোনো দুর্ভেদ্য দেয়াল নয়। সুপরিচিত ও দায়িত্বশীল এআই কোম্পানিগুলো এই নিয়ম মেনে চলে, কিন্তু অননুমোদিত ক্ষতিকর স্ক্র্যাপাররা এটি উপেক্ষা করতে পারে। সম্পূর্ণ সুরক্ষার জন্য সিডিএন বা সার্ভার স্তরে বট সুরক্ষা নীতি কার্যকর করা প্রয়োজন।

আমি কি পুরো ওয়েবসাইট ব্লক না করে শুধু নির্দিষ্ট কোনো ফোল্ডার এআই থেকে গোপন রাখতে পারি?

হ্যাঁ, আপনি চাইলে নির্দিষ্ট ডিরেক্টরি ব্লক করতে পারেন। টুলটিতে ডিসঅ্যালাও পাথের ঘরে পুরো সাইটের / চিহ্নের বদলে /drafts/ বা আপনার গোপনীয় ফোল্ডারের পথ লিখে দিলে বটগুলো কেবল সেই ফোল্ডারে প্রবেশ করা থেকে বিরত থাকবে।

robots.txt এর সাথে llms.txt ফাইলের পার্থক্য কী?

robots.txt দিয়ে বটদের অ্যাক্সেস নিয়ন্ত্রণ বা ব্লক করা হয়, আর llms.txt ফাইলের কাজ হলো অনুমতিপ্রাপ্ত এআই মডেলদের জন্য কনটেন্টের সংক্ষিপ্ত ও সুবিন্যস্ত সারসংক্ষেপ সরবরাহ করা। আপনার সাইটের জন্য এমন ফাইল তৈরি করতে llms.txt জেনারেটর ব্যবহার করতে পারেন।

তৈরি করা robots.txt ফাইলটি সঠিকভাবে কাজ করছে কিনা তা কীভাবে পরীক্ষা করব?

ফাইলটি সার্ভারে আপলোড করার পর রোবটস.টিএক্সটি টেস্টার দিয়ে যাচাই করে নিতে পারেন। এর মাধ্যমে নির্দিষ্ট এআই বট আপনার সাইটের পেজ পড়ার অনুমতি পাচ্ছে কি না তা সরাসরি পরীক্ষা করা যায়।