চার ধরনের এআই বট এবং তাদের কাজের ধরন
ইন্টারনেটে সক্রিয় কৃত্রিম বুদ্ধিমত্তা বা এআই বটগুলোকে প্রধানত চারটি ভাগে ভাগ করা যায়। প্রতিটি বটের উদ্দেশ্য এবং কাজের ধরণ আলাদা, তাই কোনো বট ব্লক করার আগে সেটির প্রভাব জানা জরুরি।
প্রথম ভাগে রয়েছে প্রশিক্ষণ ডেটা সংগ্রহকারী বট বা ট্রেনিং ক্রলার। GPTBot, ClaudeBot, Google-Extended এবং CCBot এর অন্তর্ভুক্ত। এই বটগুলো ওয়েবসাইটের কনটেন্ট সংগ্রহ করে বড় ভাষা মডেল বা এলএলএম প্রশিক্ষণে ব্যবহার করে। এগুলোকে ব্লক করলে এআই মডেলে আপনার লেখা সরাসরি অন্তর্ভুক্ত হওয়া বন্ধ হয়।
দ্বিতীয় ভাগে রয়েছে এআই সার্চ ইনডেক্সার, যেমন OAI-SearchBot কিংবা PerplexityBot। এগুলো বিভিন্ন এআই সার্চ ইঞ্জিনের উত্তর তৈরির জন্য রিয়েল-টাইম তথ্য ইনডেক্স করে। এগুলো ব্লক করলে এআই সার্চ ফলাফলে আপনার সাইটের সূত্র বা রেফারেন্স আসা বন্ধ হয়ে যেতে পারে।
তৃতীয় ভাগে রয়েছে ব্যবহারকারী পরিচালিত ফেচার বট। যেমন কোনো চ্যাটজিপিটি ব্যবহারকারী যখন নির্দিষ্ট কোনো ওয়েবসাইটের লিঙ্ক দিয়ে সারাংশ জানতে চান, তখন ChatGPT-User বটটি সেই পাতাটি পড়ে দেখে।
চতুর্থ ভাগে রয়েছে ব্রাউজিং এজেন্ট, যা বিভিন্ন স্বয়ংক্রিয় কাজের জন্য ওয়েব ব্রাউজ করে।
এআই robots.txt জেনারেটর ব্যবহার করে আপনি সহজেই সিদ্ধান্ত নিতে পারেন কোন শ্রেণীর বটকে অনুমতি দেবেন এবং কাদের আটকে দেবেন।
জেনারেট করা robots.txt ফাইল যেভাবে কাজ করে
একটি সুগঠিত robots.txt ফাইলে মূলত দুটি স্তরে নির্দেশনা তৈরি করা হয়। প্রথম স্তরে সার্বজনীন রুল বা User-agent: * ব্লকে কনটেন্ট সিগন্যাল ও সাধারণ ব্রাউজিং অনুমতি থাকে। দ্বিতীয় স্তরে প্রতিটি নির্দিষ্ট এআই বটের জন্য আলাদা Disallow গ্রুপ তৈরি করা হয়।
ফাইলের মূল কাঠামোতে প্রতিটি বটের নাম এবং পাথ সুনির্দিষ্টভাবে উল্লেখ থাকে। নিচে সাধারণ উদাহরণের বিন্যাস দেখানো হলো:
| নির্দেশনা |
ফিল্ড ভ্যালু |
কাজের বিবরণ |
User-agent |
* |
সকল সাধারণ ক্রলারের জন্য প্রযোজ্য |
Content-Signal |
search=yes, ai-train=no |
কনটেন্ট ব্যবহারের সুনির্দিষ্ট নীতিমালা |
Allow |
/ |
ওয়েবসাইটের সাধারণ ভিজিটরদের জন্য উন্মুক্ত |
User-agent |
GPTBot |
নির্দিষ্ট এআই প্রশিক্ষণ বট |
Disallow |
/ |
সম্পূর্ণ ওয়েবসাইট পড়া থেকে বিরত রাখার অনুরোধ |
এর পাশাপাশি ফাইলে সাইটম্যাপের ঠিকানা নির্দেশ করতে Sitemap: লাইন এবং এআই তথ্যের জন্য llms.txt ফাইলের কমেন্ট যুক্ত করার অপশন থাকে। এআই robots.txt জেনারেটর এই সম্পূর্ণ ফাইলটি সরাসরি ব্রাউজারে তৈরি করে, ফলে কোনো তথ্য অন্য কোনো সার্ভারে যায় না।
কনটেন্ট সিগন্যাল বা Content-Signal নীতিমালার ভূমিকা
ঐতিহ্যবাহী Disallow নির্দেশনার বাইরে কনটেন্ট সিগন্যাল হলো এমন একটি মানসম্মত প্রোটোকল, যার মাধ্যমে ক্রলারকে জানানো যায় ওয়েবসাইটের তথ্য কোন কাজে ব্যবহার করা যাবে। এতে মূলত তিনটি প্রধান সিগন্যাল থাকে: search, ai-input, এবং ai-train।
search নির্ধারণ করে এআই সার্চ ইঞ্জিনে আপনার কনটেন্ট উদ্ধৃত হতে পারবে কি না। ai-input নির্দেশ করে ব্যবহারকারীর তাৎক্ষণিক প্রম্পটের উত্তরে তথ্য ব্যবহৃত হতে পারবে কি না। ai-train নির্দেশ করে দীর্ঘমেয়াদী মডেল প্রশিক্ষণে ডেটা ব্যবহার করা যাবে কি না। প্রতিটি সিগন্যালে yes, no, অথবা কোনো পছন্দ প্রকাশ না করার সুবিধা রয়েছে।
ক্লাউডফ্লেয়ারের মতো সেবাদাতারা এর সাথে use প্যারামিটার সমর্থন করে, যার মাধ্যমে ব্যবহারের মাত্রা নির্দিষ্ট করা যায়। এছাড়াও ফাইলে ইউরোপীয় ইউনিয়নের কপিরাইট নির্দেশিকার অনুচ্ছেদ ৪ অনুযায়ী টেক্সট ও ডেটা মাইনিং অধিকার সংরক্ষণের ঘোষণামূলক কমেন্ট যুক্ত করার ব্যবস্থা রাখা হয়েছে। এটি কনটেন্ট নির্মাতাদের মেধা সম্পত্তির ওপর নিয়ন্ত্রণ বজায় রাখতে আইনি ভিত্তি দেয়।
robots.txt এর সীমাবদ্ধতা এবং নিরাপত্তা নিশ্চিতকরণ
robots.txt ফাইলের নির্দেশনা মূলত একটি প্রযুক্তিগত অনুরোধ, কোনো অলঙ্ঘনীয় দেয়াল নয়। দায়িত্বশীল এআই প্রতিষ্ঠানগুলো এই ফাইল মেনে চলে, কিন্তু অননুমোদিত স্ক্র্যাপার বা অসাধু বট এই নিয়ম উপেক্ষা করতে পারে।
দ্বিতীয়ত, একবার যেসব কনটেন্ট পুরনো মডেলগুলোতে প্রশিক্ষণ দিয়ে সংগ্রহ করে ফেলা হয়েছে, robots.txt আপডেট করলে সেগুলো স্বয়ংক্রিয়ভাবে মুছে যায় না। এটি কেবল ভবিষ্যৎ ক্রলিং রোধ করে। তাই সম্পূর্ণ নিরাপত্তার জন্য সার্ভার-লেভেল বা সিডিএন ফায়ারওয়াল রুল ব্যবহার করা কার্যকর উপায়। প্রয়োজনে বট অথেন্টিকেশন কি জেনারেটর ব্যবহার করে অনুমোদিত বট যাচাই করা যায়।
জেনারেট করা ফাইলটি সার্ভারের মূল রুটে আপলোড করার পর কনফিগারেশন ঠিক আছে কি না তা robots.txt টেস্ট করার টুল দিয়ে পরীক্ষা করে নেওয়া উচিত। এতে সার্চ ইঞ্জিনের সূচিকরণে কোনো ভুল ব্লক তৈরি হয়েছে কি না তা সহজেই ধরা পড়ে।
robots.txt এবং llms.txt ফাইলের পারস্পরিক সম্পর্ক
ওয়েবসাইট পরিচালনার ক্ষেত্রে robots.txt এবং llms.txt দুটি সম্পূর্ণ ভিন্ন উদ্দেশ্যে কাজ করে। robots.txt নিয়ন্ত্রণ করে কে আপনার সাইটের কোন পাতা ক্রল করতে পারবে বা পারবে না। অন্যদিকে llms.txt তৈরি করা হয় এআই মডেলগুলোর পড়ার উপযোগী সংক্ষিপ্ত টেক্সট ফরম্যাটে ওয়েবসাইটের সারসংক্ষেপ তুলে ধরার জন্য।
যেহেতু robots.txt স্পেসিফিকেশনে সরাসরি llms.txt নির্দেশ করার কোনো আনুষ্ঠানিক ডিরেক্টিভ নেই, তাই এআই robots.txt জেনারেটর এটিকে একটি কমেন্ট বা মন্তব্য হিসেবে অন্তর্ভুক্ত করে। এর ফলে যেসব বট কমেন্ট পার্স করে, তারা সহজেই আপনার সাইটের মূল এআই নথির সন্ধান পায়।
আপনি যদি সাইটের জন্য কার্যকর এলএলএম ফাইল তৈরি করতে চান, তবে আলাদাভাবে llms.txt জেনারেটর টুল ব্যবহার করে ফাইলটি প্রস্তুত করে নিতে পারেন। এই দুটি ফাইলের সঠিক সমন্বয় একদিকে অনাকাঙ্ক্ষিত স্ক্র্যাপিং ঠেকায়, অন্যদিকে বৈধ এআই উত্তরগুলোতে সাইটের তথ্য নিখুঁতভাবে উপস্থাপনে সাহায্য করে।