技术 SEO

Robots.txt 规则测试工具

粘贴 robots.txt 文件,选择一个爬虫,再测试任意路径。精确查看哪条规则生效,并揪出那些悄悄屏蔽搜索引擎或浪费抓取预算的错误。

完全在您的浏览器中运行。除匿名使用次数外,您粘贴的内容不会发送到任何地方。

请粘贴您 robots.txt 文件的完整内容。

仅填路径和可选查询字符串,不含域名,例如 /blog/post-1?ref=x。

工作原理,以及如何修复常见错误

真实的爬虫会选择与自己名称匹配的单个最具体的 User-agent 组(精确匹配或最长前缀匹配优先于 "*"),然后只在该组内应用路径模式匹配最长的 Allow 或 Disallow 规则,长度相同时 Allow 获胜。本工具运行的正是这套算法 — 而不是简单地查找第一个 Disallow。

规则中的 "*" 匹配任意字符序列,末尾的 "$" 则将规则锚定在路径末尾。Disallow: /*.pdf$ 会屏蔽 /file.pdf,但不会屏蔽 /file.pdf?ref=1 — 这是 PDF 文件意外仍可被抓取的常见原因。

空的 "Disallow:" 行表示完全没有限制 — 它不会屏蔽任何内容。而且一旦爬虫匹配到某个具体的组(如 "Googlebot"),"User-agent: *" 下的规则对该爬虫将完全被忽略;二者绝不会合并。

本工具会标记的常见错误:测试站点遗留下来的 Disallow: /(屏蔽全站)、写在任何 User-agent 行之前的规则(会被静默忽略)、Crawl-delay(Google 和 Bing 均忽略)、以及不是绝对地址的 Sitemap URL。

📊 这个页面有多准确?

点一个表情来评分 — 然后看看大家的想法。

0%

无法保存你的投票 — 请重试。

4