SEO เชิงเทคนิค
เครื่องมือทดสอบกฎ Robots.txt
วางไฟล์ robots.txt เลือก crawler แล้วทดสอบ path ใดก็ได้ ดูให้ชัดว่ากฎใดชนะ และจับข้อผิดพลาดที่แอบบล็อกเสิร์ชเอนจินหรือทำให้ crawl budget เสียเปล่า
ทำงานในเบราว์เซอร์ของคุณทั้งหมด ไม่มีอะไรที่คุณวางไว้ถูกส่งไปที่ใดนอกจากจำนวนการใช้งานแบบไม่ระบุตัวตน
วางเนื้อหาที่แน่นอนของไฟล์ robots.txt ของคุณ
ใส่เฉพาะ path และ query string ที่ต้องการ ไม่ต้องมีโดเมน เช่น /blog/post-1?ref=x
หลักการทำงาน และวิธีแก้ข้อผิดพลาดที่พบบ่อย
Crawler จริงจะเลือกกลุ่ม User-agent ที่เฉพาะเจาะจงที่สุดเพียงกลุ่มเดียวที่ตรงกับชื่อของมัน (การจับคู่แบบตรงทั้งหมดหรือ prefix ยาวที่สุดชนะ "*") จากนั้นภายในกลุ่มนั้นเท่านั้นจะใช้กฎ Allow หรือ Disallow ที่มีรูปแบบ path ยาวที่สุดที่ตรงกัน โดย Allow จะชนะเมื่อเสมอกัน เครื่องมือนี้ทำงานตามอัลกอริทึมนี้เป๊ะๆ ไม่ใช่แค่หา Disallow ตัวแรกที่เจอ
"*" ในกฎจะจับคู่กับลำดับอักขระใดก็ได้ และ "$" ท้ายกฎจะยึด path ไว้ที่ตำแหน่งสุดท้าย Disallow: /*.pdf$ จะบล็อก /file.pdf แต่ไม่บล็อก /file.pdf?ref=1 ซึ่งเป็นสาเหตุทั่วไปที่ทำให้ PDF ยังถูก crawl ได้โดยไม่ตั้งใจ
บรรทัด "Disallow:" ที่ว่างเปล่าหมายถึงไม่มีข้อจำกัดใดๆ เลย — ไม่บล็อกอะไรทั้งสิ้น และเมื่อ crawler ตรงกับกลุ่มเฉพาะ (เช่น "Googlebot") กฎภายใต้ "User-agent: *" จะถูกละเลยทั้งหมดสำหรับ crawler นั้น ไม่มีการรวมกฎทั้งสองเข้าด้วยกัน
ข้อผิดพลาดทั่วไปที่เครื่องมือนี้ตรวจพบ: Disallow: / ที่หลงเหลือจากเว็บ staging (บล็อกทั้งเว็บ), กฎที่วางไว้ก่อนบรรทัด User-agent ใดๆ (ถูกละเลยแบบเงียบๆ), Crawl-delay (Google และ Bing ไม่สนใจ), และ URL ของ Sitemap ที่ไม่ใช่ absolute