เลือกภาษา

เครื่องมือสร้าง robots.txt บล็อก AI และบอทเทรนโมเดล

กำหนดค่า robots.txt บล็อกบอท AI กว่า 50 ชนิด แยกประเภทบอทเทรนโมเดลและบอทค้นหา พร้อมรองรับ Content-Signal และตั้งค่าพาธที่ต้องการป้องกัน

สร้าง robots.txt บล็อก AIวิธีใช้งาน ↓
ทำดัชนีหน้านี้และแสดงลิงก์พร้อมข้อความที่ตัดตอนมาสั้นๆ
ใช้หน้านี้เป็นข้อมูลอ้างอิงสำหรับคำตอบที่สร้างขึ้น
ใช้หน้านี้เพื่อฝึกฝนหรือปรับแต่งโมเดล AI
ส่วนขยาย Cloudflare: ขอบเขตที่บอทนำเนื้อหาที่ดึงไปใช้ต่อได้
ข้อความทางกฎหมายที่ช่วยให้สัญญาณมีผลบังคับใช้ตามกฎหมายลิขสิทธิ์ของ EU
การบล็อกสิ่งเหล่านี้ไม่มีผลต่อการแสดงผลในการค้นหาทั่วไป
การบล็อกสิ่งเหล่านี้จะนำคุณออกจากคำตอบการค้นหาของ AI และการอ้างอิง
การบล็อกสิ่งเหล่านี้จะป้องกันไม่ให้ผู้ช่วย AI เปิดหน้าเว็บของคุณตามคำขอ
เอเจนต์ที่คลิกและกรอกฟอร์มแทนผู้ใช้งาน
ใช้ / สำหรับทั้งเว็บไซต์ หรือระบุโฟลเดอร์ เช่น /articles/
จำเป็นสำหรับตัวชี้ Sitemap และ llms.txt เท่านั้น
เพิ่มเป็นคอมเมนต์ เนื่องจาก robots.txt ไม่มีคำสั่ง llms.txt

robots.txt และ Content-Signal เป็นเพียงการระบุความต้องการ ไม่สามารถบล็อกได้ด้วยตัวเอง บอทที่ปฏิบัติตามกฎจะยอมรับข้อกำหนดนี้ ส่วนบอทอื่นอาจเพิกเฉย และ Google ระบุว่าไม่ได้ดำเนินการตาม Content-Signal โปรดใช้กฎการบล็อกบอทที่ฝั่งเซิร์ฟเวอร์หากต้องการบังคับใช้อย่างจริงจัง

Mehmet Demiray (เมห์เมต เดมิเรย์) เผยแพร่ อัปเดตล่าสุด
แชร์

ประเภทของบอต AI ทั้ง 4 รูปแบบและผลกระทบต่อเว็บไซต์

การจัดการการเข้าถึงของปัญญาประดิษฐ์เริ่มต้นจากการทำความเข้าใจว่าโปรแกรมรวบรวมข้อมูลหรือบอตแต่ละตัวมีวัตถุประสงค์การทำงานที่แตกต่างกัน บอต AI ในปัจจุบันแบ่งออกเป็น 4 กลุ่มหลักตามพฤติกรรมการประมวลผลข้อมูล

  1. บอตรวบรวมข้อมูลเพื่อฝึกฝนโมเดล (Training Data Collectors) บอตกลุ่มนี้มีหน้าที่ดูดเนื้อหาปริมาณมหาศาลจากอินเทอร์เน็ตไปใช้พัฒนาโมเดลภาษาขนาดใหญ่ ตัวอย่างสำคัญได้แก่ GPTBot ของ OpenAI, ClaudeBot ของ Anthropic, CCBot ของ Common Crawl และ Google-Extended ของ Google การบล็อกบอตกลุ่มนี้จะช่วยป้องกันไม่ให้ผลงานเขียนหรืองานสร้างสรรค์ถูกนำไปใช้เทรน AI รุ่นใหม่โดยไม่ได้รับอนุญาต
  1. บอตสำหรับระบบค้นหาด้วย AI (AI Search Indexers) บอตอย่าง OAI-SearchBot หรือ PerplexityBot ทำหน้าที่จัดทำดัชนีเนื้อหาเพื่อให้ระบบสืบค้นของ AI สามารถค้นหาข้อมูลล่าสุดไปแสดงผลพร้อมใส่ลิงก์อ้างอิงกลับมายังเว็บไซต์ หากคุณเลือกบล็อกบอตกลุ่มนี้ เว็บไซต์ของคุณจะไม่ปรากฏในผลการค้นหาหรือการอ้างอิงแหล่งที่มาของระบบ AI Search
  1. บอตที่ทำงานตามคำสั่งผู้ใช้ (User-Triggered Fetchers) เช่น ChatGPT-User บอตกลุ่มนี้จะทำงานเฉพาะเมื่อผู้ใช้งานป้อนคำสั่งหรือระบุ URL ให้ AI เข้าไปอ่านหน้าเว็บนั้นโดยตรงเพื่อสรุปเนื้อหาหรือตอบคำถามเฉพาะจุด การเปิดให้บอตกลุ่มนี้เข้าถึงช่วยให้ผู้ใช้ทั่วไปสามารถนำเนื้อหาของคุณไปวิเคราะห์ในแชตบอตได้ตามต้องการ
  1. บอตท่องเว็บอัตโนมัติ (Browsing Agents) บอตกลุ่มนี้ทำหน้าที่เสมือนตัวแทนของผู้ใช้ในการสืบค้นข้อมูลเชิงลึก ทำงานแบบอัตโนมัติหลายขั้นตอน และดึงข้อมูลโครงสร้างเพื่อประกอบการตัดสินใจของระบบตัวแทนอัจฉริยะ

การเลือกปรับแต่งไฟล์ผ่าน เครื่องมือสร้าง robots.txt บล็อก AI ทำให้ผู้ดูแลเว็บสามารถเลือกอนุญาตหรือปฏิเสธบอตแต่ละกลุ่มได้อย่างเจาะจง โดยไม่จำเป็นต้องปิดกั้นการเข้าถึงทั้งหมด

โครงสร้างและการทำงานของไฟล์ robots.txt ที่สร้างขึ้น

ไฟล์ที่ได้จาก เครื่องมือสร้าง robots.txt บล็อก AI ถูกออกแบบให้ทำงานสองระดับควบคู่กันเพื่อสร้างมาตรฐานความปลอดภัยที่ครอบคลุม ทั้งการส่งสัญญาณนโยบายภาพรวมและการระบุคำสั่งเจาะจงรายบอต

ส่วนแรกของไฟล์คือกลุ่มคำสั่งทั่วไป User-agent: * ซึ่งประกอบด้วยคำสั่ง Allow: / เพื่อเปิดให้บอตทั่วไปและเครื่องมือค้นหามาตรฐานเข้าถึงเว็บไซต์ได้ตามปกติ พร้อมทั้งระบุบรรทัด Content-Signal ซึ่งเป็นมาตรฐานใหม่สำหรับแจ้งเงื่อนไขการนำข้อมูลไปประมวลผลต่อ

ส่วนที่สองคือกลุ่มคำสั่งเฉพาะสำหรับบอต AI ที่ต้องการบล็อก ระบบจะสร้างบล็อกคำสั่งแยกตามชื่อของบอตแต่ละตัวที่มีการเลือกไว้ เช่น

คำสั่งในไฟล์ คำอธิบายการทำงาน
User-agent: GPTBot ระบุเป้าหมายไปยังบอตเก็บข้อมูลฝึกฝนของ OpenAI
Disallow: / ปฏิเสธการเข้าถึงทุกโฟลเดอร์บนเว็บไซต์
User-agent: ClaudeBot ระบุเป้าหมายไปยังบอตเก็บข้อมูลของ Anthropic
Disallow: / ปฏิเสธการเข้าถึงทุกโฟลเดอร์บนเว็บไซต์

ส่วนสุดท้ายของไฟล์รองรับการระบุ Sitemap: เพื่อนำทางเครื่องมือค้นหาไปยังแผนผังเว็บไซต์ และข้อความหมายเหตุชี้เป้าไปยังไฟล์ llms.txt สำหรับผู้ที่จัดทำชุดข้อมูลสรุปสำหรับ AI โดยระบบจะประมวลผลสตริงทั้งหมดภายในเบราว์เซอร์ของผู้ใช้งานโดยไม่มีการส่งข้อมูลออกไปยังเซิร์ฟเวอร์ภายนอก

ทำความเข้าใจ Content-Signal มาตรฐานใหม่เพื่อกำหนดสิทธิ์ข้อมูล

มาตรฐาน Content-Signal พัฒนาขึ้นโดยความร่วมมือของเครือข่ายผู้ให้บริการเว็บเพื่อเป็นกลไกกลางในการส่งสัญญาณความยินยอมในการใช้เนื้อหาดิจิทัล โดยบรรทัดคำสั่งนี้จะถูกวางไว้ใต้กลุ่ม User-agent: * ในไฟล์ robots.txt

สัญญาณหลัก 3 รูปแบบประกอบด้วย - search กำหนดสิทธิ์ให้ระบบสามารถนำเนื้อหาไปจัดทำดัชนีเพื่อการค้นหาและการอ้างอิงคำตอบ - ai-input กำหนดสิทธิ์ให้ระบบ AI นำเนื้อหาไปประมวลผลเป็นข้อมูลนำเข้าชั่วคราวสำหรับการตอบคำถามของผู้ใช้ - ai-train กำหนดสิทธิ์ในการนำข้อมูลไปใช้ฝึกฝนโมเดล AI ในระยะยาว

ค่าของแต่ละสัญญาณสามารถระบุเป็น allow เพื่ออนุญาต หรือ disallow เพื่อปฏิเสธ หากผู้ดูแลเว็บไม่ต้องการระบุเงื่อนไขสำหรับหัวข้อใด ระบบจะไม่ใส่ค่านั้นลงในบรรทัดคำสั่ง นอกจากนี้ยังมีส่วนขยายของ Cloudflare ที่เรียกว่า use ซึ่งแบ่งออกเป็น 3 ระดับ ได้แก่ immediate สำหรับการประมวลผลทันที reference สำหรับการอ้างอิงแหล่งที่มา และ full สำหรับการใช้งานทุกรูปแบบ

เครื่องมือสร้าง robots.txt บล็อก AI ยังมีตัวเลือกเสริมสำหรับใส่ข้อความระบุสิทธิ์ตามกฎหมาย Directive (EU) 2019/790 Article 4 ซึ่งเป็นการประกาศสงวนสิทธิ์การทำเหมืองข้อความและข้อมูล (Text and Data Mining) สำหรับเจ้าของผลงานในสหภาพยุโรปอย่างเป็นทางการ

กลยุทธ์การตั้งค่า robots.txt ให้เหมาะกับประเภทเว็บไซต์

ความต้องการในการควบคุมบอต AI ของแต่ละเว็บไซต์มีความแตกต่างกัน การเลือกชุดคำสั่งที่เหมาะสมช่วยรักษาสมดุลระหว่างการคุ้มครองทรัพย์สินทางปัญญาและการคงอยู่ของการเข้าชมจากผู้ใช้

สำหรับบล็อกเกอร์ ผู้ผลิตบทความ และสำนักข่าวที่ต้องการให้ AI อ้างอิงบทความแต่ไม่ต้องการให้นำข้อมูลไปเทรนโมเดล ควรเลือกรูปแบบการบล็อกเฉพาะบอตเทรนข้อมูล (Training crawlers only) การตั้งค่านี้จะบล็อกบอตอย่าง GPTBot, ClaudeBot และ CCBot แต่ยังเปิดทางให้ OAI-SearchBot และ PerplexityBot เข้ามาอ่านเนื้อหา ส่งผลให้เว็บไซต์ยังมีโอกาสถูกนำไปใส่ลิงก์อ้างอิงในคำตอบของ AI

สำหรับเว็บไซต์ที่มีข้อมูลเฉพาะ ฐานข้อมูลสมาชิก หรือเนื้อหาที่ไม่ต้องการให้ระบบ AI ใดๆ เข้าถึงเลย ควรเลือกรูปแบบการบล็อกบอต AI ทั้งหมด (All AI crawlers) ซึ่งระบบจะสร้างคำสั่งปฏิเสธบอต AI ในฐานข้อมูลมากกว่า 50 ตัว

กรณีที่ต้องการจำกัดการเข้าถึงเฉพาะบางส่วนของเว็บไซต์ ผู้ดูแลระบบสามารถแก้ไข Disallow Path จากค่าเริ่มต้น / เป็นเส้นทางเฉพาะ เช่น /private/, /drafts/ หรือ /members/ เพื่อปกป้องเฉพาะส่วนที่มีความละเอียดอ่อนในขณะที่เปิดให้บอตเข้าถึงส่วนสาธารณะได้ตามปกติ

ข้อจำกัดของ robots.txt และการป้องกันร่วมกับระบบไฟร์วอลล์

ไฟล์ robots.txt เป็นเพียงมาตรฐานความร่วมมือระดับซอฟต์แวร์ (Advisory Standard) หมายความว่าบอตที่ปฏิบัติตามกฎจะอ่านไฟล์และเคารพข้อกำหนด แต่บอตนิรนามหรือเครื่องมือเก็บข้อมูลที่ตั้งค่าแบบไม่สุจริตสามารถเพิกเฉยต่อคำสั่งเหล่านี้ได้

การระบุคำสั่งใน robots.txt ไม่สามารถลบข้อมูลที่ถูกบอตดูดไปเทรนโมเดลแล้วในอดีตได้ แต่เป็นการป้องกันสำหรับการเก็บข้อมูลรอบใหม่ในอนาคตเท่านั้น นอกจากนี้ บอตบางค่ายอาจยังไม่รองรับมาตรฐาน Content-Signal อย่างเป็นทางการ

เพื่อให้การป้องกันมีประสิทธิภาพสูงสุด ควรใช้ robots.txt ควบคู่กับการควบคุมฝั่งเซิร์ฟเวอร์ 1. การตั้งค่าระบบป้องกันบอตที่ระดับ CDN หรือ Cloudflare เพื่อตรวจจับและสกัดกั้นทราฟฟิกที่ไม่พึงประสงค์ตั้งแต่ขอบเครือข่าย 2. การตั้งค่า Web Application Firewall (WAF) เพื่อบล็อก IP Address หรือพฤติกรรมการเรียกหน้าที่ผิดปกติ 3. การใช้ เครื่องมือสร้างคีย์ยืนยันตัวตนบอต เพื่อตรวจสอบบอตที่น่าเชื่อถือด้วยลายเซ็นดิจิทัล

หลังจากสร้างและอัปโหลดไฟล์ robots.txt ไปยังไดเรกทอรีหลักของโดเมนแล้ว ควรตรวจสอบโครงสร้างคำสั่งผ่าน เครื่องมือตรวจสอบ robots.txt เพื่อยืนยันว่าบอตแต่ละตัวถูกจัดกลุ่มและปฏิเสธอย่างถูกต้องตามที่วางแผนไว้

ความแตกต่างระหว่าง robots.txt และ llms.txt ในการจัดการ AI

ทั้ง robots.txt และ llms.txt เป็นไฟล์ข้อความที่วางไว้บนไดเรกทอรีรากของเว็บไซต์ แต่มีบทบาทและวัตถุประสงค์ที่ตรงข้ามกันอย่างสิ้นเชิง

robots.txt ทำหน้าที่เป็นเอกสารควบคุมสิทธิ์การเข้าถึง โดยระบุว่าบอตตัวใดได้รับอนุญาตหรือถูกห้ามไม่ให้เข้าถึงหน้าเว็บใด ส่วน llms.txt ทำหน้าที่เป็นแผนผังเนื้อหาแบบย่อในรูปแบบ Markdown ที่คัดสรรมาเพื่อให้อ่านและประมวลผลได้ง่าย ซึ่งช่วยให้โมเดลภาษาขนาดใหญ่เข้าใจภาพรวม ผลิตภัณฑ์ หรือบริการของเว็บไซต์ได้อย่างถูกต้องและกระชับ

มาตรฐานข้อกำหนดของ robots.txt ในปัจจุบันยังไม่มีคำสั่งทางการสำหรับการประกาศพาธของ llms.txt ดังนั้น เครื่องมือสร้าง robots.txt บล็อก AI จึงใส่ลิงก์ระบุตำแหน่งของ llms.txt ในรูปแบบของบรรทัดหมายเหตุ (Comment Line) ไว้ที่ท้ายไฟล์ เพื่อให้โปรแกรมอ่านข้อมูลที่พัฒนาขึ้นใหม่สามารถค้นหาไฟล์สรุปข้อมูลได้สะดวก

หากคุณต้องการเปิดให้ AI นำข้อมูลสรุปขององค์กรไปใช้งานอย่างมีประสิทธิภาพ สามารถใช้ เครื่องมือสร้างไฟล์ llms.txt ในการจัดทำเอกสารประกอบควบคู่ไปกับการตั้งค่าไฟล์ robots.txt

คำถามที่เราตอบบ่อยที่สุด

วิธีบล็อกบอท AI ไม่ให้เก็บข้อมูลเว็บไซต์ทำอย่างไร

คุณสามารถเลือกชุดคำสั่งสำเร็จรูปจากเครื่องมือสร้าง robots.txt บล็อก AI ปรับแต่งบอทที่ต้องการบล็อก จากนั้นคัดลอกหรือดาวน์โหลดไฟล์ robots.txt ไปวางไว้ที่โฟลเดอร์หลักของเว็บไซต์ หลังจากอัปโหลดเสร็จ ให้ตรวจสอบความถูกต้องด้วย เครื่องมือทดสอบ robots.txt เพื่อยืนยันว่ากฎทำงานได้ตามที่ต้องการ

บอท AI แต่ละประเภท เช่น GPTBot, OAI-SearchBot และ ChatGPT-User ต่างกันอย่างไร

บอทแต่ละตัวมีหน้าที่ต่างกันอย่างชัดเจน GPTBot ทำหน้าที่เก็บข้อมูลทั้งเว็บเพื่อนำไปฝึกฝนโมเดล AI ส่วน OAI-SearchBot ใช้ทำดัชนีสำหรับระบบค้นหาด้วย AI เพื่อนำเนื้อหาไปแสดงผลพร้อมการอ้างอิง และ ChatGPT-User จะทำงานเมื่อผู้ใช้งานสั่งให้ AI เข้าไปอ่านหน้าเว็บปลายทางโดยตรง การบล็อกเฉพาะบอทฝึกฝนข้อมูลจะไม่กระทบต่อการถูกนำไปอ้างอิงในระบบค้นหา AI

การบล็อกบอท AI จะส่งผลกระทบต่ออันดับบน Google หรือไม่

การบล็อกบอท AI สำหรับฝึกฝนโมเดลจะไม่ส่งผลต่อการจัดอันดับบน Google Search ทั่วไป การบล็อก Google-Extended จะป้องกันไม่ให้ Google นำเนื้อหาไปฝึกฝนโมเดล Gemini เท่านั้น โดยที่ Googlebot สำหรับค้นหายังคงเข้ามาเก็บข้อมูลและจัดอันดับเว็บไซต์ได้ตามปกติ แต่หากคุณเลือกบล็อกบอทกลุ่มค้นหา AI เว็บไซต์ก็จะไม่ปรากฏในคำตอบที่ระบบค้นหา AI อ้างอิง

คำสั่ง Content-Signal ในไฟล์ robots.txt คืออะไร

Content-Signal เป็นมาตรฐานสำหรับระบุความยินยอมในการนำเนื้อหาไปประมวลผลผ่านหมวด search, ai-input และ ai-train ซึ่งต่างจากคำสั่ง Disallow ตรงที่ไม่ได้ห้ามการเข้ามาอ่านหน้าเว็บ แต่เป็นการส่งสัญญาณทางนโยบายว่าเจ้าของเว็บไซต์อนุญาตให้นำเนื้อหาไปใช้ฝึกฝนโมเดล AI หรือนำไปใช้อ้างอิงสร้างคำตอบหรือไม่

ไฟล์ robots.txt สามารถหยุดการดูดข้อมูลของ AI ได้ทั้งหมดหรือไม่

robots.txt เป็นมาตรฐานที่บอทคุณภาพจะปฏิบัติตาม แต่บอทที่ไม่ประสงค์ดีอาจเลือกที่จะละเลยคำสั่งได้ หากคุณต้องการการป้องกันอย่างสมบูรณ์ ควรตั้งค่าไฟร์วอลล์ระดับเซิร์ฟเวอร์หรือ CDN ควบคู่ไปด้วย และสามารถตรวจสอบตัวตนของบอทที่เข้ามาผ่าน ตัวสร้างคีย์ยืนยันตัวตนเว็บบอท

ทำไมเครื่องมือถึงมีตัวเลือกใส่ลิงก์ llms.txt และมีความแตกต่างกันอย่างไร

robots.txt ทำหน้าที่ระบุสิทธิ์การเข้าถึงหน้าเว็บของบอทแต่ละตัว ส่วน llms.txt เป็นไฟล์ที่สรุปเนื้อหาโครงสร้างเว็บไซต์เพื่อให้โมเดลภาษาขนาดใหญ่เข้าใจบริบทของเว็บได้สะดวกรวดเร็ว เครื่องมือนี้มีตัวเลือกเพิ่มบรรทัดหมายเหตุชี้ไปยัง llms.txt โดยคุณสามารถจัดเตรียมไฟล์ดังกล่าวได้ด้วย เครื่องมือสร้าง llms.txt

เครื่องมือสร้าง robots.txt บล็อก AI ต่างจากการตั้งค่าบล็อกอัตโนมัติบน Cloudflare อย่างไร

ระบบอัตโนมัติของ Cloudflare ใช้ได้เฉพาะเว็บไซต์ที่เชื่อมต่อกับ Cloudflare และมักบล็อกบอท AI ทั้งหมดพร้อมกัน แต่เครื่องมือสร้าง robots.txt บล็อก AI ใช้งานได้กับเว็บโฮสติ้งทุกรูปแบบ และเปิดโอกาสให้คุณปรับแต่งกฎได้ละเอียดตามต้องการ เช่น อนุญาตให้บอทค้นหา AI เข้าถึงได้ แต่ปิดกั้นเฉพาะบอทที่เก็บข้อมูลไปฝึกฝนโมเดล

สามารถตั้งค่าบล็อกบอท AI เฉพาะบางโฟลเดอร์ในเว็บไซต์ได้หรือไม่

ทำได้โดยการระบุเส้นทางที่ต้องการในช่อง Disallow path เช่น ใส่เส้นทางเฉพาะอย่างโฟลเดอร์ฉบับร่างหรือเนื้อหาส่วนตัว คำสั่งจะบล็อกบอท AI ไม่ให้เข้าถึงเฉพาะโฟลเดอร์นั้น ในขณะที่บอทยังสามารถเข้าถึงหน้าอื่นๆ ของเว็บไซต์ได้ตามปกติ