SEO เชิงเทคนิค

เครื่องมือทดสอบกฎ Robots.txt

วางไฟล์ robots.txt เลือก crawler แล้วทดสอบ path ใดก็ได้ ดูให้ชัดว่ากฎใดชนะ และจับข้อผิดพลาดที่แอบบล็อกเสิร์ชเอนจินหรือทำให้ crawl budget เสียเปล่า

ทำงานในเบราว์เซอร์ของคุณทั้งหมด ไม่มีอะไรที่คุณวางไว้ถูกส่งไปที่ใดนอกจากจำนวนการใช้งานแบบไม่ระบุตัวตน

วางเนื้อหาที่แน่นอนของไฟล์ robots.txt ของคุณ

ใส่เฉพาะ path และ query string ที่ต้องการ ไม่ต้องมีโดเมน เช่น /blog/post-1?ref=x

หลักการทำงาน และวิธีแก้ข้อผิดพลาดที่พบบ่อย

Crawler จริงจะเลือกกลุ่ม User-agent ที่เฉพาะเจาะจงที่สุดเพียงกลุ่มเดียวที่ตรงกับชื่อของมัน (การจับคู่แบบตรงทั้งหมดหรือ prefix ยาวที่สุดชนะ "*") จากนั้นภายในกลุ่มนั้นเท่านั้นจะใช้กฎ Allow หรือ Disallow ที่มีรูปแบบ path ยาวที่สุดที่ตรงกัน โดย Allow จะชนะเมื่อเสมอกัน เครื่องมือนี้ทำงานตามอัลกอริทึมนี้เป๊ะๆ ไม่ใช่แค่หา Disallow ตัวแรกที่เจอ

"*" ในกฎจะจับคู่กับลำดับอักขระใดก็ได้ และ "$" ท้ายกฎจะยึด path ไว้ที่ตำแหน่งสุดท้าย Disallow: /*.pdf$ จะบล็อก /file.pdf แต่ไม่บล็อก /file.pdf?ref=1 ซึ่งเป็นสาเหตุทั่วไปที่ทำให้ PDF ยังถูก crawl ได้โดยไม่ตั้งใจ

บรรทัด "Disallow:" ที่ว่างเปล่าหมายถึงไม่มีข้อจำกัดใดๆ เลย — ไม่บล็อกอะไรทั้งสิ้น และเมื่อ crawler ตรงกับกลุ่มเฉพาะ (เช่น "Googlebot") กฎภายใต้ "User-agent: *" จะถูกละเลยทั้งหมดสำหรับ crawler นั้น ไม่มีการรวมกฎทั้งสองเข้าด้วยกัน

ข้อผิดพลาดทั่วไปที่เครื่องมือนี้ตรวจพบ: Disallow: / ที่หลงเหลือจากเว็บ staging (บล็อกทั้งเว็บ), กฎที่วางไว้ก่อนบรรทัด User-agent ใดๆ (ถูกละเลยแบบเงียบๆ), Crawl-delay (Google และ Bing ไม่สนใจ), และ URL ของ Sitemap ที่ไม่ใช่ absolute

📊 หน้านี้แม่นยำแค่ไหน?

แตะหน้ายิ้มเพื่อให้คะแนน — แล้วดูว่าทุกคนคิดอย่างไร

0%

บันทึกคะแนนไม่สำเร็จ — โปรดลองอีกครั้ง

4