内容 SEO

Duplicate Content Checker(重复内容检测)

粘贴两段文本——草稿与发布版本、你的文章与竞争对手的文章、或你的页面与转载副本——逐句查看究竟重叠了多少。

匹配基于词级 shingle(连续词序列),因此适用于任何拉丁字母语言。对于书写时词与词之间没有空格的语言(如中文、泰语、高棉语),信号会更粗略——对这些语言,请把分数当作方向性参考,而非精确数值。

此工具检测什么

搜索引擎对大幅重复其他地方已收录内容的页面持谨慎态度——无论是被抓取、未注明来源地转载,还是从未重写的旧草稿。此工具测量两份文档之间的真实文本重叠:整体相似度评分、哪些句子是逐字重复或高度改写,以及两者共有的最长逐字短语。

评分是如何计算的

该引擎使用 w-shingling(词级切片)——这与搜索引擎和查重工具用于近似重复检测的技术是同一类方法——而非简单的字符差异比较,因此即使段落顺序调换或有小幅编辑,仍能被捕捉到。

文档相似度(shingle 上的 Jaccard 指数)

两段文本都被切分为重叠的 6 词序列("shingle")。Jaccard 指数——共有 shingle 数除以所有唯一 shingle 总数——给出一个即使段落被重新排序也依然稳健的整体相似度评分。

内容重叠(包含度 containment)

当一段文本比另一段短得多时,仅用 Jaccard 会低估重叠程度(一段长文章中的简短引用,即使 100% 被复制,Jaccard 分数也会很低)。Containment 分别衡量较短文本的 shingle 有多大比例出现在较长文本中(双向计算),从而捕捉到这种情况。

句子级匹配

文本 A 中的每个句子都会与文本 B 中的每个句子进行更细粒度的相同 shingle 重叠比较,然后被归类为完全匹配、近似重复(改写级别的重叠)或独特句子。

最长逐字重复片段

在匹配的句子对中,工具会找出两段文本共有的最长连续逐字词序列——一段较长的逐字重复片段,比中等的整体分数更能说明重复内容的问题。

常见问题

重叠多少会被 Google 视为"重复内容"?

Google 从未公布确切阈值,近似重复检测只是众多信号之一。作为实用参考:30-55% 的重叠值得复查;55% 以上(尤其是有多个完全匹配的句子或一段较长的逐字重复片段)就存在两个页面互相竞争或蚕食彼此排名的实际风险,或者其中一个被视为缺乏原创性。

如果我自己的两个页面得分很高该怎么办?

要么对内容做有意义的区分(不同角度、更深入、不同搜索意图)并互相链接,要么选择更强的那个页面,将较弱的页面 301 重定向或设置 canonical 指向它。发布两个几乎相同、争夺同一查询词的页面,通常对两者的排名都没有帮助。

我在检查转载内容——重复一定是坏事吗?

不一定。只要 canonical 页面明确,搜索引擎能够很好地处理合法的转载内容——在转载副本上使用跨域的 rel="canonical" 标签指向原文,或确保转载合作方这样做。

这个工具会把我的文本发送到哪里吗?

两段文本会通过 HTTPS 发送一次到我们的服务器以运行比较(需要将匹配逻辑保留在服务器端以保证一致性),请求结束后不会被存储。