テクニカルSEO
Robots.txt ルールテスター
robots.txt を貼り付け、クローラーを選び、任意のパスをテストしましょう。どのルールが実際に効いているかを正確に確認し、検索エンジンを知らずにブロックしたりクロールバジェットを無駄にしたりするミスを見つけます。
すべてブラウザ内で完結します。匿名の利用回数を除き、貼り付けた内容がどこかに送信されることはありません。
robots.txt ファイルの内容をそのまま貼り付けてください。
ドメインなしで、パスと任意のクエリ文字列のみ。例: /blog/post-1?ref=x
仕組みと、よくあるミスの直し方
実際のクローラーは自分の名前に最も合致する単一の User-agent グループを選び(完全一致または最長前方一致が "*" に勝ちます)、そのグループの中だけで、パスパターンが最も長く一致する Allow または Disallow ルールを適用します(長さが同じ場合は Allow が勝ちます)。このツールはまさにそのアルゴリズムを実行しており、最初に見つけた Disallow を単に採用するわけではありません。
ルール内の "*" は任意の文字列に一致し、末尾の "$" はパスの終端にルールを固定します。Disallow: /*.pdf$ は /file.pdf をブロックしますが /file.pdf?ref=1 はブロックしません — PDF が意図せずクロール可能なままになる典型的な原因です。
空の "Disallow:" 行は「制限なし」を意味し、何もブロックしません。また、クローラーが特定のグループ(例: "Googlebot")に一致した時点で、そのクローラーにとって "User-agent: *" 以下のルールは完全に無視されます。両者がマージされることはありません。
このツールが検出するよくあるミス: ステージングサイトから残ってしまった Disallow: /(全体をブロック)、User-agent 行より前に置かれたルール(黙って無視される)、Crawl-delay(Google と Bing は無視)、絶対URLになっていない Sitemap。