技術 SEO

Robots.txt 差異與部署風險檢查器

貼上而家線上用緊嘅 robots.txt 同即將部署嗰個版本。呢個工具會針對你揀嘅爬蟲同路徑,用真正嘅最長匹配/萬用字元/$ 規則引擎逐一運行兩個檔案,然後精準標出改變咗嘅地方——同埋係咪可以安全上線。

全部喺你嘅瀏覽器入面運行。除咗匿名嘅使用次數之外,你喺呢度貼嘅內容唔會傳送去任何地方。

如果只想單獨審查新檔案,唔使做前後比較,可以留空。

你即將部署嘅版本。

規則引擎每次只針對一個爬蟲運行——真正嘅爬蟲永遠唔會將專用分組同萬用字元分組合併。

淨係填路徑同可選嘅 query string,唔使域名。記得包括首頁、重要模板同你擔心嘅路徑。

工作原理,同埋點解淨係文字 diff 唔夠

普通嘅逐行文字 diff 冇辦法話俾你知對爬蟲嚟講究竟改變咗啲乜嘢:調整分組次序、加多條抵消 Disallow 嘅 Allow、或者更長更具體嘅規則覆蓋咗較短嘅規則——呢啲改動都會改變實際行為,但係喺文字 diff 上未必睇得出。呢個工具會用真正嘅爬蟲演算法——最具體嘅 User-agent 分組優先,跟住匹配最長嘅 Allow/Disallow 規則優先,打和就 Allow 贏——喺兩個檔案上面重新運行,然後比較結果,而唔係比較文字行。

嚴重程度睇改變咗啲乜嘢:首頁新被封鎖或者出現全站 Disallow 屬於嚴重;CSS/JS 檔案新被封鎖,或者睇落敏感嘅路徑(admin、checkout、account、.env)新畀人開放屬於警告;其他新封鎖或者新允許嘅路徑就屬於提示,等你自己核實。

呢個工具仲會獨立於你所列嘅路徑去檢查結構性變化:新檔案係咪引入咗全面嘅 "Disallow: /"、Sitemap 指令係咪悄悄被刪除、以及邊啲爬蟲專屬分組畀人加咗或者刪咗。

記住 Google 同 Bing 會完全忽略 Crawl-delay;而且一旦某個爬蟲匹配到好似 "Googlebot" 咁樣嘅專屬分組,"User-agent: *" 下面嘅規則就永遠唔會應用喺佢度——兩者唔會合併。

📊 呢版嘢有幾準確?

㩒一個表情評分 — 再睇下大家點諗。

0%

儲存唔到你嘅投票 — 請再試一次。

1