技術 SEO
Robots.txt 規則測試工具
貼上 robots.txt 檔案,揀選一個爬蟲,再測試任何路徑。清清楚楚睇邊條規則生效,揪出嗰啲靜靜雞封鎖搜尋引擎或者浪費 crawl budget 嘅錯誤。
完全喺你嘅瀏覽器度運行。除咗匿名使用次數之外,你貼喺呢度嘅內容唔會傳去任何地方。
請貼上你 robots.txt 檔案嘅完整內容。
淨係填路徑同可選查詢字串,唔使域名,例如 /blog/post-1?ref=x。
運作原理,同埋點樣修復常見錯誤
真正嘅爬蟲會揀選同自己名稱最匹配嘅單一個 User-agent 組(完全匹配或者最長前綴匹配會贏 "*"),然後淨係喺嗰個組入面,套用路徑模式匹配得最長嘅 Allow 或 Disallow 規則,長度一樣就 Allow 贏。呢個工具行緊嘅正正就係呢套演算法 — 唔係淨係揾第一個搵到嘅 Disallow。
規則入面嘅 "*" 匹配任何字符序列,而結尾嘅 "$" 就將規則錨定喺路徑嘅結尾。Disallow: /*.pdf$ 會封鎖 /file.pdf,但唔會封鎖 /file.pdf?ref=1 — 呢個係 PDF 檔案意外之下仲可以俾人爬嘅常見原因。
空嘅 "Disallow:" 一行代表完全冇任何限制 — 佢乜嘢都唔會封鎖。而且一旦爬蟲匹配到某個特定組(好似 "Googlebot"),對於嗰個爬蟲嚟講,"User-agent: *" 下面嘅規則會完全被忽略;兩者絕對唔會合併。
呢個工具會標記嘅常見錯誤:測試站遺留低嘅 Disallow: /(封鎖成個網站)、寫喺任何 User-agent 一行之前嘅規則(會靜靜雞被忽略)、Crawl-delay(Google 同 Bing 都忽略)、同埋唔係絕對地址嘅 Sitemap URL。