เลือกภาษา

เครื่องมือทดสอบและตรวจสอบไฟล์ robots.txt

จำลองการอ่านกฎ robots.txt ตามมาตรฐาน RFC 9309 ตรวจสอบการบล็อก URL แยกตามบอตค้นหาและ AI พร้อมระบุบรรทัดกฎที่ส่งผลทันทีในเบราว์เซอร์

เครื่องมือทดสอบ robots.txtวิธีใช้งาน ↓
วางเนื้อหาไฟล์ที่แสดงบน /robots.txt การประมวลผลทำในเบราว์เซอร์ของคุณโดยไม่มีการอัปโหลดข้อมูล
โทเค็นระบุตัวตนเช่น Googlebot, GPTBot หรือ ClaudeBot หรือสตริง User-Agent แบบเต็ม
บรรทัดละหนึ่งรายการ URL แบบเต็มจะถูกตัดเหลือเฉพาะเส้นทางและพารามิเตอร์คิวรี

เป็นไปตามมาตรฐาน RFC 9309 รวมถึงไวลด์การ์ด * และแองเคอร์ท้ายบรรทัด $: กลุ่มของบอตเองจะมีความสำคัญเหนือกว่ากลุ่ม * โดยกฎที่ตรงกันยาวที่สุดจะชนะ และหากเสมอกันจะใช้สิทธิ์ Allow ทั้งนี้ บอตจริงอาจมีพฤติกรรมต่างกันในบางกรณีพิเศษ

Mehmet Demiray (เมห์เมต เดมิเรย์) เผยแพร่ อัปเดตล่าสุด
แชร์

การจับคู่กลุ่ม User-agent และกลไกการทำงานของ robots.txt

ไฟล์ robots.txt ทำหน้าที่กำหนดสิทธิ์ให้โปรแกรมรวบรวมข้อมูลหรือบอทค้นหา (Crawler) เข้าถึงเนื้อหาในแต่ละส่วนของเว็บไซต์ โครงสร้างของไฟล์จะแบ่งกฎออกเป็นกลุ่มตามคำสั่ง User-agent ซึ่งบอทแต่ละตัวจะมีหลักการเลือกกลุ่มกฎที่ตรงกับตัวเองตามมาตรฐาน RFC 9309

เมื่อบอทเข้ามาอ่านไฟล์ จะเริ่มค้นหากลุ่มที่มีชื่อระบุเจาะจงถึงตัวมันเองก่อนเป็นอันดับแรก หากไม่มีชื่อเฉพาะ ระบบจะมองหากลุ่มของชื่อหลัก เช่น Googlebot-Image จะมองหากลุ่ม Googlebot-Image ก่อน หากไม่พบจึงจะใช้กฎในกลุ่ม Googlebot และหากไม่พบกลุ่มที่ตรงกันเลย บอทจะนำกฎในกลุ่มสากล User-agent: * มาปรับใช้แทน

จุดสำคัญที่ผู้ดูแลเว็บไซต์มักเข้าใจผิดคือ กฎจากกลุ่มเฉพาะจะไม่นำมารวมกับกลุ่มสากล หากมีการระบุกลุ่มเฉพาะสำหรับบอทตัวใดตัวหนึ่ง บอทตัวนั้นจะอ่านและปฏิบัติตามเฉพาะกฎที่อยู่ในกลุ่มของตัวเองเท่านั้น และจะละเลยคำสั่งทั้งหมดในกลุ่ม * โดยสิ้นเชิง หากในกลุ่มเฉพาะไม่ได้กำหนดคำสั่ง Disallow ไว้ บอทตัวนั้นก็จะมีสิทธิ์เข้าถึงทุกหน้าในเว็บไซต์ได้ทั้งหมด แม้ว่ากลุ่ม * จะมีคำสั่งปิดกั้นไว้ก็ตาม

ในกรณีที่มีการระบุกลุ่ม User-agent เดียวกันแยกไว้หลายจุดในไฟล์เดียวกัน เครื่องมือทดสอบ robots.txt จะทำการรวมกฎของกลุ่มที่ชื่อเหมือนกันเข้าด้วยกันโดยอัตโนมัติตามมาตรฐานกลาง ช่วยให้คุณตรวจสอบได้ว่าบอทแต่ละตัวจะได้รับผลลัพธ์การอนุญาตที่ถูกต้องหรือไม่ก่อนนำไฟล์จริงไปติดตั้งบนเซิร์ฟเวอร์

หลักการ Longest Match และลำดับความสำคัญของกฎ

เมื่อมีหลายกฎในกลุ่มเดียวกันที่ตรงกับ URL เป้าหมาย มาตรฐาน RFC 9309 กำหนดให้ใช้กฎที่มีความยาวของเส้นทางจับคู่มากที่สุด หรือหลักการ Longest Match ความยาวของกฎจะวัดจากจำนวนตัวอักษรของสตริงเส้นทางที่กำหนดไว้ในคำสั่ง Allow หรือ Disallow

คำสั่งใน robots.txt ความยาวของกฎ ผลลัพธ์สำหรับ URL: /blog/tech/post-1
Disallow: / 1 ตัวอักษร แพ้กฎที่ยาวกว่า
Disallow: /blog/ 6 ตัวอักษร แพ้กฎที่ยาวกว่า
Allow: /blog/tech/ 11 ตัวอักษร ชนะ (อนุญาตให้เข้าถึง)

หากกฎ Allow และ Disallow มีความยาวเท่ากันและตรงกับ URL ทั้งคู่ ระบบจะตัดสินให้ Allow เป็นฝ่ายชนะเสมอ นอกจากนี้ยังมีเงื่อนไขเฉพาะที่ควรรู้ดังนี้

  • คำสั่ง Disallow: ที่ไม่มีการระบุเส้นทางต่อท้าย หมายถึงการอนุญาตให้เข้าถึงได้ทั้งหมด
  • หากไม่มีกฎใดตรงกับ URL เป้าหมายเลย ระบบจะอนุญาตให้บอทเข้าถึงได้ตามค่าเริ่มต้น
  • เครื่องหมาย * ใช้แทนข้อความใดๆ ในเส้นทาง เช่น Disallow: /*.pdf จะปิดกั้นไฟล์ PDF ทั้งหมดในเว็บไซต์
  • เครื่องหมาย $ ใช้ระบุจุดสิ้นสุดของเส้นทาง เช่น Disallow: /*.pdf$ จะจับคู่เฉพาะ URL ที่ลงท้ายด้วยนามสกุลไฟล์ PDF เท่านั้น และจะไม่กระทบกับ /document.pdf?version=2

เครื่องมือทดสอบ robots.txt จะประมวลผลกฎทั้งหมดตามลำดับความยาว พร้อมระบุเลขบรรทัดที่เป็นตัวตัดสินชี้ขาด ทำให้คุณทราบได้ทันทีว่าทำไม URL จึงได้รับผลลัพธ์เป็นอนุญาตหรือปิดกั้น

การทดสอบสิทธิ์เข้าถึงของ AI Crawler และ Content-Signal

การเติบโตของโมเดลปัญญาประดิษฐ์ทำให้มีบอทประเภท AI เข้ามารวบรวมข้อมูลเว็บไซต์เพื่อนำไปฝึกฝนและประมวลผลคำตอบ บอทเหล่านี้มีชื่อเรียกเฉพาะ เช่น GPTBot, ClaudeBot, Google-Extended และ PerplexityBot ซึ่งคุณสามารถกำหนดสิทธิ์แยกต่างหากจากบอทของเครื่องมือค้นหาทั่วไปได้

ในการบริหารจัดการเนื้อหาสำหรับ AI คุณสามารถใช้ เครื่องมือสร้าง robots.txt สำหรับ AI เพื่อกำหนดค่าสิทธิ์การเข้าถึงอย่างเป็นระบบ จากนั้นนำข้อความที่ได้มาทดสอบความถูกต้องในเครื่องมือนี้ โดยใส่ชื่อบอท AI และรายชื่อ URL ที่ต้องการทดสอบ เพื่อตรวจสอบว่ากฎที่เขียนไว้สามารถปิดกั้นหรือเปิดทางให้โมเดล AI แต่ละค่ายได้ตรงตามความประสงค์หรือไม่

นอกจากคำสั่งมาตรฐาน ยังมีการใช้คำสั่ง Content-Signal ซึ่งเป็นข้อกำหนดเพื่อระบุเจตนาการนำเนื้อหาไปใช้งาน เช่น search, ai-input หรือ ai-train คำสั่งนี้เป็นเพียงการประกาศนโยบายเชิงสิทธิ์ เครื่องมือทดสอบ robots.txt จะรายงานค่าที่ตรวจพบในแต่ละกลุ่มให้คุณทราบเพื่อความครบถ้วน แต่จะไม่นำมาเป็นเงื่อนไขทางเทคนิคในการสั่งปิดกั้นการเข้าถึงเส้นทาง

สำหรับการจัดเตรียมโครงสร้างเอกสารเพื่อรองรับการใช้งานร่วมกับระบบปัญญาประดิษฐ์ คุณสามารถใช้งานร่วมกับ เครื่องมือสร้าง llms.txt เพื่อสร้างไฟล์สรุปข้อมูลเว็บไซต์สำหรับ LLM ควบคู่ไปกับการควบคุมสิทธิ์การเก็บข้อมูลผ่าน robots.txt

ข้อผิดพลาดทั่วไปที่พบบ่อยในการเขียน robots.txt

ข้อผิดพลาดเพียงเล็กน้อยในไฟล์ robots.txt อาจส่งผลกระทบต่อการจัดอันดับบนเครื่องมือค้นหา หรือทำให้หน้าสำคัญถูกดักไม่ให้บอทเข้าถึง เครื่องมือทดสอบ robots.txt ได้รับการออกแบบมาเพื่อช่วยตรวจจับไวยากรณ์ที่ไม่ถูกต้องและแจ้งเตือนข้อผิดพลาดสำคัญ ดังนี้

  1. การวางกฎก่อนการประกาศ User-agent: คำสั่ง Allow หรือ Disallow ที่อยู่ส่วนบนสุดของไฟล์ก่อนที่จะมีบรรทัด User-agent ใดๆ จะถือว่าไม่มีผลบังคับใช้และถูกข้ามไปทั้งหมด
  2. การระบุเส้นทางสัมพัทธ์โดยไม่มีเครื่องหมายทับนำหน้า: เส้นทางทั้งหมดในคำสั่งต้องขึ้นต้นด้วย / เช่น การเขียน Disallow: private/ เป็นรูปแบบที่ไม่ถูกต้อง ต้องแก้เป็น Disallow: /private/
  3. การใช้คำสั่ง Crawl-delay: คำสั่งหน่วงเวลาการเข้าชมไม่ได้อยู่ในมาตรฐาน RFC 9309 และ Googlebot ไม่รองรับคำสั่งนี้ หากต้องการจำกัดการส่งคำขอ ควรตั้งค่าที่ฝั่งเว็บเซิร์ฟเวอร์โดยตรง
  4. คำสั่งเฉพาะระบบ เช่น Host หรือ Clean-param: คำสั่งเหล่านี้สร้างขึ้นมาเพื่อบอทบางกลุ่มเท่านั้น เช่น Yandex และไม่ถือเป็นมาตรฐานกลางสำหรับบอททั่วไป
  5. การใส่คำสั่ง Noindex ใน robots.txt: บอทส่วนใหญ่รวมถึง Google จะละเลยคำสั่ง Noindex ภายในไฟล์ robots.txt หากต้องการไม่ให้หน้านั้นแสดงบนผลการค้นหา ต้องใส่แท็ก Meta Robots หรือส่วนหัว HTTP Response แทน

นอกจากนี้ ตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ในเส้นทาง URL มีผลแตกต่างกันอย่างสิ้นเชิง กฎ Disallow: /Admin/ จะไม่สามารถปิดกั้นเส้นทาง /admin/ ได้

ขอบเขตการทำงานและความปลอดภัยของเครื่องมือทดสอบ robots.txt

เครื่องมือทดสอบ robots.txt ทำงานและประมวลผลทั้งหมดภายในเว็บเบราว์เซอร์บนอุปกรณ์ของคุณโดยตรง ไม่มีการส่งข้อมูลข้อความหรือ URL กลับไปยังเซิร์ฟเวอร์ใดๆ ทำให้คุณสามารถทดสอบร่างไฟล์ robots.txt ที่ยังไม่ได้เผยแพร่ หรือตรวจสอบกฎของเว็บไซต์ทดสอบภายใน (Staging) ได้อย่างปลอดภัยโดยที่ข้อมูลไม่รั่วไหล

การใช้งานเครื่องมือนี้มีขอบเขตและข้อกำหนดการทำงานที่ควรทราบดังนี้

  • ประมวลผลเฉพาะข้อความที่วางลงในช่อง: เครื่องมือจะไม่อ่านไฟล์สดจากอินเทอร์เน็ต เพื่อให้คุณแก้ไขและทดลองกฎรูปแบบต่างๆ ได้อย่างอิสระโดยไม่ต้องติดตั้งไฟล์จริง
  • แปลง URL อัตโนมัติ: หากคุณวาง URL เต็ม เช่น https://example.com/shop/item?id=12 เครื่องมือจะตัดโดเมนออกและใช้เฉพาะส่วนของเส้นทางและพารามิเตอร์ /shop/item?id=12 มาจับคู่กับกฎ
  • ควบคุมการเข้าถึง ไม่ใช่การแสดงผลการค้นหา: คำสั่งใน robots.txt ทำหน้าที่เพียงห้ามไม่ให้บอทเข้ามาดึงข้อมูลหน้าเว็บ (Crawling) แต่หากมีเว็บไซต์อื่นสร้างลิงก์มายังหน้านั้น หน้าเว็บที่ถูกบล็อกก็ยังอาจปรากฏในผลการค้นหาได้โดยไม่มีข้อความสรุปตัวอย่าง
  • การยืนยันความถูกต้องของบอท: robots.txt เป็นเพียงไฟล์ข้อตกลง ไม่สามารถป้องกันบอทสแปมที่ปลอมแปลงชื่อได้ หากต้องการตรวจสอบความถูกต้องของบอทที่เข้ามาจริง สามารถใช้งาน เครื่องมือสร้างคีย์ยืนยันตัวตนบอท เพื่อเสริมความปลอดภัยในระดับระบบเครือข่าย

คำถามที่เราตอบบ่อยที่สุด

วิธีตรวจสอบว่า URL ถูกบล็อกโดย robots.txt หรือไม่ทำอย่างไร?

คุณสามารถวางเนื้อหาจากไฟล์ robots.txt ลงในช่องข้อความ ระบุชื่อบอทที่ต้องการ เช่น Googlebot หรือ GPTBot และใส่รายการ URL หรือเส้นทางที่ต้องการทดสอบ เครื่องมือทดสอบ robots.txt จะประมวลผลทันทีและแสดงสถานะว่า URL นั้นได้รับอนุญาตหรือถูกปิดกั้น พร้อมระบุหมายเลขบรรทัดและกฎที่นำมาใช้ตัดสิน

ต้องสมัครสมาชิกหรือเชื่อมต่อเว็บไซต์จริงเพื่อใช้งานหรือไม่?

คุณไม่จำเป็นต้องลงทะเบียนหรือมีเว็บไซต์ออนไลน์จริง การทำงานทั้งหมดประมวลผลภายในเบราว์เซอร์ของคุณโดยตรง คุณจึงสามารถนำร่างไฟล์ robots.txt ที่กำลังพัฒนามาทดสอบความถูกต้องได้ทันทีก่อนนำไปติดตั้งใช้งานจริงบนระบบ

สามารถใส่ URL เต็มรูปแบบที่มีชื่อโดเมนในการตรวจสอบได้หรือไม่?

สามารถใส่ URL แบบเต็มได้ ระบบจะตัดชื่อโดเมนและโปรโตคอลออกโดยอัตโนมัติ เพื่อนำเฉพาะส่วนของเส้นทางและพารามิเตอร์มาตรวจสอบเทียบกับกฎตามมาตรฐาน RFC 9309

หากมีทั้งกฎ Allow และ Disallow ที่ตรงกับ URL เดียวกัน ระบบจะเลือกใช้กฎใด?

ระบบจะเลือกใช้กฎที่มีรูปแบบความยาวตัวอักษรตรงกับ URL มากที่สุดตามข้อกำหนดมาตรฐาน หากความยาวของกฎทั้งสองเท่ากันพอดี กฎ Allow จะมีสิทธิ์เหนือกว่า Disallow เสมอ

หากบอทที่ทดสอบไม่ได้ระบุชื่อไว้ในไฟล์ กฎใดจะมีผลบังคับใช้?

หากไม่พบกลุ่มที่ระบุชื่อบอทนั้นไว้โดยเฉพาะ บอทจะข้ามไปใช้กฎของกลุ่มสากล User-agent: * แทน แต่หากในไฟล์ไม่มีกลุ่มสากลระบุไว้ บอทจะถือว่าได้รับอนุญาตให้เข้าถึงได้ทุกส่วนของเว็บไซต์

การใส่ Disallow ใน robots.txt ช่วยลบหน้าเว็บออกจากผลการค้นหาได้หรือไม่?

ไม่ได้ robots.txt ควบคุมเฉพาะการเข้ามาเก็บข้อมูลของบอทเท่านั้น แต่ไม่ได้ป้องกันการจัดทำดัชนี หากหน้านั้นมีลิงก์จากภายนอกชี้เข้ามา เครื่องมือค้นหายังคงนำ URL ไปแสดงในผลการค้นหาได้ หากต้องการป้องกันไม่ให้หน้าเว็บแสดงผลอย่างแท้จริงควรใช้แท็ก noindex ร่วมด้วย

หากต้องการกำหนดและทดสอบกฎสำหรับบอทปัญญาประดิษฐ์ควรเริ่มต้นอย่างไร?

คุณสามารถสร้างชุดคำสั่งที่เหมาะสมผ่าน เครื่องมือสร้าง robots.txt สำหรับ AI แล้วนำเนื้อหาที่ได้มาทดสอบกับเครื่องมือทดสอบ robots.txt เพื่อตรวจสอบว่าระบบปิดกั้นหรือเปิดรับบอทอย่าง GPTBot หรือ ClaudeBot ได้ถูกต้องตามวัตถุประสงค์

เครื่องมือนี้แตกต่างจากรายงานใน Google Search Console อย่างไร?

Google Search Console จะตรวจสอบเฉพาะไฟล์ robots.txt ที่ดึงมาจากเว็บไซต์จริงที่คุณยืนยันสิทธิ์แล้ว แต่เครื่องมือนี้เปิดให้คุณวางไฟล์ฉบับร่างเพื่อทดสอบได้ทันที รองรับบอททุกรูปแบบ และทำงานบนอุปกรณ์ของคุณโดยไม่ต้องยืนยันสิทธิ์ความเป็นเจ้าของโดเมน