コンテンツ SEO
Duplicate Content Checker(重複コンテンツ検出)
2つのテキスト——下書きと公開版、自分の記事と競合の記事、または自分のページとシンジケート先のコピー——を貼り付けて、文単位でどれだけ重複しているかを正確に確認できます。
照合は単語シングル(連続する単語の並び)に基づくため、ラテン文字の言語であればどれでも機能します。単語間にスペースを使わない言語(中国語、タイ語、クメール語など)では信号が粗くなります——これらの言語ではスコアを正確な数値ではなく、方向性の目安として捉えてください。
このツールがチェックする内容
検索エンジンは、他所ですでにインデックスされているコンテンツを大幅に繰り返しているページ——スクレイピングされたもの、出典表示なしで転載されたもの、書き直されないまま残っている古い下書きなど——を警戒します。このツールは2つの文書間の実際のテキスト重複を測定します:全体的な類似度スコア、どの文が一言一句同じ、あるいは近いパラフレーズか、そして両方に共通する最長の逐語フレーズです。
スコアの計算方法
このエンジンは、検索エンジンや盗用チェックツールがニアデュプリケート検出に用いるのと同系統の技術である w-shingling を使用します。単純な文字差分ではないため、段落の並べ替えや軽微な編集があっても検出できます。
文書の類似度(シングル上の Jaccard 係数)
両方のテキストは重なり合う6単語の並び(「シングル」)に分割されます。Jaccard 係数——共通シングル数を全ユニークシングル数で割った値——は、段落が並べ替えられても頑健な全体的な類似度スコアを与えます。
コンテンツの重複度(containment)
一方のテキストがもう一方よりはるかに短い場合、Jaccard 単独では重複を過小評価します(長い記事に埋め込まれた短い引用は、たとえ100%コピーされていても Jaccard スコアは低くなります)。Containment は、短い方のテキストのシングルのうち何割が長い方に出現するかを双方向に測定し、このケースを検出します。
文単位のマッチング
テキスト A の各文は、同じシングル重複の手法をより細かい粒度で用いてテキスト B のすべての文と比較され、完全一致・近似重複(パラフレーズレベルの重複)・ユニークのいずれかに分類されます。
最長の逐語一致
マッチした文のペアの中から、ツールは両テキストに共通する最長の完全に連続した逐語的な単語列を見つけます——1つの長い逐語一致は、中程度の全体スコアよりも強力な重複コンテンツのシグナルです。
よくある質問
Google にとって、どの程度の重複が「重複コンテンツ」とみなされますか?
Google は正確なしきい値を公表したことはなく、ニアデュプリケート検出は数あるシグナルの1つに過ぎません。実用的な目安としては、重複が30〜55%であれば見直す価値があり、55%以上(特に完全一致の文がいくつかある、または1つの長い逐語一致がある場合)は、2つのページが互いに競合・共食いする、あるいは一方がオリジナリティに欠けると見なされる実際のリスクがあります。
自分の2つのページが高いスコアになった場合はどうすればよいですか?
コンテンツを意味のある形で差別化する(異なる切り口、より深い内容、異なる検索意図)か、相互にリンクするか、あるいはより強いページを選んで弱い方から301リダイレクト/canonical を設定してください。同じクエリを狙うほぼ同一の2ページを公開しても、どちらのランキングにもほとんど役立ちません。
シンジケートされたコンテンツをチェックしています——重複は常に悪いことですか?
いいえ。canonical ページが明確であれば、検索エンジンは正当にシンジケートされたコンテンツを問題なく処理します——シンジケートされたコピー側にオリジナルを指すクロスドメインの rel="canonical" タグを設定するか、シンジケート先のパートナーがそれを行っていることを確認してください。
このツールは私のテキストをどこかに送信しますか?
両方のテキストは、比較を実行するために HTTPS 経由で一度だけサーバーに送信され(マッチングロジックをサーバー側に保ち一貫性を保つために必要です)、リクエスト終了後は保存されません。