콘텐츠 SEO

Duplicate Content Checker

초안과 게시본, 내 글과 경쟁사의 글, 또는 내 페이지와 재배포(신디케이션)된 사본 등 두 개의 텍스트를 붙여넣으면 문장 단위로 정확히 얼마나 겹치는지 확인할 수 있습니다.

매칭은 단어 셔글(word-shingle, 연속된 단어 시퀀스) 기반이므로 라틴 문자를 쓰는 모든 언어에서 작동합니다. 단어 사이에 띄어쓰기가 없는 언어(중국어, 태국어, 크메르어 등)는 신호가 더 거칠어지므로, 해당 언어에서는 점수를 정확한 값이 아니라 방향성 참고치로 봐 주세요.

이 도구가 검사하는 것

검색엔진은 다른 곳에 이미 색인된 콘텐츠를 상당 부분 반복하는 페이지를 경계합니다 — 스크래핑되었든, 출처 표시 없이 재배포되었든, 다시 쓰이지 않은 오래된 초안이든 말이죠. 이 도구는 두 문서 간의 실제 텍스트 중복을 측정합니다: 전체 유사도 점수, 어떤 문장이 완전히 동일하거나 근접한 바꿔쓰기(paraphrase)인지, 그리고 두 텍스트가 공유하는 가장 긴 그대로의 구절까지 알려줍니다.

점수 계산 방식

이 엔진은 검색엔진과 표절 검사 도구가 유사 중복 탐지에 사용하는 것과 같은 계열의 기법인 w-셔글링(w-shingling)을 사용합니다. 단순 문자 비교(diff)가 아니기 때문에 문단 순서가 바뀌거나 약간 수정되어도 여전히 탐지됩니다.

문서 유사도 (셔글에 대한 Jaccard 지수)

두 텍스트 모두 겹치는 6단어 시퀀스("셔글")로 분할됩니다. Jaccard 지수 — 공유 셔글 수를 전체 고유 셔글 수로 나눈 값 — 는 문단이 재배열되어도 안정적인 전체 유사도 점수를 제공합니다.

콘텐츠 중복도(containment)

한쪽 텍스트가 다른 쪽보다 훨씬 짧을 때 Jaccard만으로는 중복을 과소평가합니다(긴 글 안의 짧은 인용문은 100% 그대로 복사되었더라도 Jaccard 점수는 낮게 나옵니다). Containment는 더 짧은 텍스트의 셔글 중 몇 퍼센트가 더 긴 텍스트에 나타나는지를 양방향으로 측정해 이런 경우를 잡아냅니다.

문장 단위 매칭

텍스트 A의 모든 문장은 더 세밀한 단위로 동일한 셔글 중복 기법을 사용해 텍스트 B의 모든 문장과 비교된 뒤, 완전 일치·유사 중복(바꿔쓰기 수준의 중복)·고유 문장 중 하나로 분류됩니다.

가장 긴 그대로의 구간

매칭된 문장 쌍 중에서, 이 도구는 두 텍스트가 공유하는 가장 긴 연속된 완전 일치 단어 시퀀스를 찾아냅니다 — 길게 이어지는 그대로의 일치 구간 하나는 중간 수준의 전체 점수보다 더 강력한 중복 콘텐츠 신호입니다.

자주 묻는 질문

얼마나 겹쳐야 Google이 "중복 콘텐츠"로 간주하나요?

Google은 정확한 기준을 공개한 적이 없으며, 유사 중복 탐지는 여러 신호 중 하나일 뿐입니다. 실용적인 기준으로는 30-55%의 중복은 검토할 가치가 있고, 55% 이상(특히 완전히 일치하는 문장이 여러 개 있거나 하나의 긴 그대로 구간이 있는 경우)은 두 페이지가 서로 경쟁하거나 순위를 잠식하거나, 한쪽이 독창성이 없다고 간주될 실질적인 위험이 있습니다.

내 페이지 두 개가 높은 점수를 받았다면 어떻게 해야 하나요?

콘텐츠를 의미 있게 차별화하거나(다른 관점, 더 깊은 내용, 다른 검색 의도) 서로 링크로 연결하세요. 아니면 더 강한 페이지를 선택해 약한 페이지를 301 리다이렉트하거나 canonical로 지정하세요. 같은 검색어를 두고 거의 동일한 두 페이지를 게시하는 것은 두 페이지 모두의 순위에 거의 도움이 되지 않습니다.

재배포(신디케이션)된 콘텐츠를 확인 중인데, 중복이 항상 나쁜가요?

아닙니다. canonical 페이지가 명확하기만 하면 검색엔진은 정당하게 재배포된 콘텐츠를 잘 처리합니다 — 재배포된 사본에 원본을 가리키는 크로스 도메인 rel="canonical" 태그를 사용하거나, 재배포 파트너가 그렇게 하도록 하세요.

이 도구가 제 텍스트를 어딘가로 전송하나요?

두 텍스트는 비교를 실행하기 위해 HTTPS를 통해 한 번만 서버로 전송되며(매칭 로직을 서버 측에 두어 일관성을 유지하기 위해 필요합니다), 요청 이후에는 저장되지 않습니다.