技術 SEO
Robots.txt 差異與部署風險檢查器
貼上而家線上用緊嘅 robots.txt 同即將部署嗰個版本。呢個工具會針對你揀嘅爬蟲同路徑,用真正嘅最長匹配/萬用字元/$ 規則引擎逐一運行兩個檔案,然後精準標出改變咗嘅地方——同埋係咪可以安全上線。
全部喺你嘅瀏覽器入面運行。除咗匿名嘅使用次數之外,你喺呢度貼嘅內容唔會傳送去任何地方。
如果只想單獨審查新檔案,唔使做前後比較,可以留空。
你即將部署嘅版本。
規則引擎每次只針對一個爬蟲運行——真正嘅爬蟲永遠唔會將專用分組同萬用字元分組合併。
淨係填路徑同可選嘅 query string,唔使域名。記得包括首頁、重要模板同你擔心嘅路徑。
工作原理,同埋點解淨係文字 diff 唔夠
普通嘅逐行文字 diff 冇辦法話俾你知對爬蟲嚟講究竟改變咗啲乜嘢:調整分組次序、加多條抵消 Disallow 嘅 Allow、或者更長更具體嘅規則覆蓋咗較短嘅規則——呢啲改動都會改變實際行為,但係喺文字 diff 上未必睇得出。呢個工具會用真正嘅爬蟲演算法——最具體嘅 User-agent 分組優先,跟住匹配最長嘅 Allow/Disallow 規則優先,打和就 Allow 贏——喺兩個檔案上面重新運行,然後比較結果,而唔係比較文字行。
嚴重程度睇改變咗啲乜嘢:首頁新被封鎖或者出現全站 Disallow 屬於嚴重;CSS/JS 檔案新被封鎖,或者睇落敏感嘅路徑(admin、checkout、account、.env)新畀人開放屬於警告;其他新封鎖或者新允許嘅路徑就屬於提示,等你自己核實。
呢個工具仲會獨立於你所列嘅路徑去檢查結構性變化:新檔案係咪引入咗全面嘅 "Disallow: /"、Sitemap 指令係咪悄悄被刪除、以及邊啲爬蟲專屬分組畀人加咗或者刪咗。
記住 Google 同 Bing 會完全忽略 Crawl-delay;而且一旦某個爬蟲匹配到好似 "Googlebot" 咁樣嘅專屬分組,"User-agent: *" 下面嘅規則就永遠唔會應用喺佢度——兩者唔會合併。