Контентное SEO

Duplicate Content Checker

Вставьте два текста — черновик и опубликованную версию, вашу статью и статью конкурента, или вашу страницу и синдицированную копию — и увидите, насколько именно они пересекаются, предложение за предложением.

Сопоставление основано на word-shingle (последовательности идущих подряд слов), поэтому работает для любого языка на латинице. Для языков, где между словами нет пробелов (китайский, тайский, кхмерский), сигнал будет более грубым — воспринимайте оценку как ориентировочную, а не точную, для таких языков.

Что проверяет этот инструмент

Поисковые системы настороженно относятся к страницам, которые в значительной степени повторяют контент, уже проиндексированный в другом месте — будь то скопированный контент, синдицированный без указания источника, или старый черновик, который так и не переписали. Этот инструмент измеряет реальное текстовое пересечение между двумя документами: общую оценку схожести, какие предложения совпадают дословно или являются близким пересказом, и одну самую длинную дословную фразу, общую для обоих текстов.

Как рассчитывается оценка

Движок использует w-шинглинг — технику того же семейства, что применяют поисковые системы и антиплагиатные инструменты для обнаружения почти-дублей — а не наивное посимвольное сравнение, поэтому переставленные абзацы и небольшие правки всё равно улавливаются.

Схожесть документов (индекс Жаккара по шинглам)

Оба текста разбиваются на перекрывающиеся последовательности из 6 слов ("шинглы"). Индекс Жаккара — количество общих шинглов, делённое на общее число уникальных шинглов — даёт общую оценку схожести, устойчивую к перестановке абзацев.

Пересечение контента (containment)

Один только индекс Жаккара занижает результат, когда один текст намного короче другого (короткая цитата внутри длинной статьи даёт низкий Jaccard, даже если цитата скопирована на 100%). Containment измеряет, какая доля шинглов более короткого текста встречается в более длинном, в обоих направлениях, и таким образом улавливает этот случай.

Сопоставление на уровне предложений

Каждое предложение в Тексте A сравнивается с каждым предложением в Тексте B тем же методом пересечения шинглов, но более детально, после чего классифицируется как точное совпадение, почти дубликат (пересечение на уровне пересказа) или уникальное.

Самый длинный дословный фрагмент

Среди совпавших пар предложений инструмент находит самую длинную непрерывную дословно совпадающую последовательность слов, общую для обоих текстов — один длинный дословный фрагмент является более сильным сигналом дублирования контента, чем средняя общая оценка.

Часто задаваемые вопросы

Какой процент пересечения Google считает "дублирующимся контентом"?

Google никогда не публиковал точный порог, а обнаружение почти-дублей — лишь один из многих сигналов. Практический ориентир: пересечение 30-55% стоит проверить, 55% и выше (особенно при наличии нескольких точно совпадающих предложений или одного длинного дословного фрагмента) — реальный риск того, что две страницы конкурируют друг с другом или каннибализируют трафик, либо одна из них воспринимается как неоригинальная.

Что делать, если две мои собственные страницы получили высокую оценку?

Либо содержательно дифференцируйте контент (другой ракурс, больше глубины, другое намерение поиска) и перелинкуйте их, либо выберите более сильную страницу и сделайте 301-редирект / canonical со слабой на неё. Публикация двух почти идентичных страниц, конкурирующих за один и тот же запрос, редко помогает ранжированию какой-либо из них.

Я проверяю синдицированный контент — дублирование всегда плохо?

Нет. Поисковые системы нормально обрабатывают легитимно синдицированный контент, если canonical-страница ясно указана — используйте междоменный тег rel="canonical", указывающий на оригинал, на синдицированной копии, либо убедитесь, что это делает партнёр по синдикации.

Отправляет ли этот инструмент мой текст куда-либо?

Оба текста отправляются один раз, по HTTPS, на наш сервер для выполнения сравнения (это необходимо, чтобы логика сопоставления оставалась на стороне сервера и была согласованной), и не сохраняются после обработки запроса.