內容 SEO
Duplicate Content Checker(重複內容檢測)
貼上兩段文字——草稿同發佈版本、你篇文同對手篇文、或者你頁面同轉載副本——逐句睇下究竟重疊咗幾多。
匹配係以詞級 shingle(連續詞序列)為基礎,所以適用於任何拉丁字母語言。對於書寫時字與字之間冇空格嘅語言(例如中文、泰文、高棉文),信號會粗略啲——呢啲語言嘅分數當係方向性參考就得,唔好當係精確數值。
呢個工具會檢查啲乜嘢
搜尋引擎對大幅重複其他地方已收錄內容嘅頁面會有戒心——唔理係俾人爬咗(scrape)、未註明出處就轉載,定係一份舊草稿從未重寫過。呢個工具量度兩份文件之間嘅真實文字重疊:整體相似度評分、邊啲句子係逐字重複或者高度改寫、以及兩者共有嘅最長逐字短語。
評分點樣計算
呢個引擎用緊 w-shingling(詞級切片)——同搜尋引擎同查重工具用嚟做近似重複檢測嘅係同一類技術——而唔係簡單嘅字符差異比較,所以即使段落次序調換或者有小改動,都仲係捕捉得到。
文件相似度(shingle 上嘅 Jaccard 指數)
兩段文字都會被切分做重疊嘅 6 詞序列(「shingle」)。Jaccard 指數——共有 shingle 數除以所有獨特 shingle 總數——會俾一個即使段落重新排列都仲穩健嘅整體相似度評分。
內容重疊(包含度 containment)
當一段文字比另一段短好多嘅時候,淨係用 Jaccard 會低估重疊程度(一篇長文入面嘅短引用,就算 100% 俾人抄咗,Jaccard 分數都會好低)。Containment 分別量度較短文字嘅 shingle 有幾大比例出現喺較長文字入面(雙向計算),所以捕捉到呢種情況。
句子級匹配
文本 A 入面每個句子都會同文本 B 入面每個句子做更細粒度嘅相同 shingle 重疊比較,然後歸類做完全匹配、近似重複(改寫級別嘅重疊)或者獨特句子。
最長逐字重複片段
喺匹配咗嘅句子對入面,工具會搵出兩段文字共有嘅最長連續逐字詞序列——一段較長嘅逐字重複片段,比中等嘅整體分數更能講明重複內容嘅問題。
常見問題
重疊幾多會俾 Google 當係「重複內容」?
Google 從來冇公佈過確實門檻,近似重複檢測都只係眾多信號之一。作為實用參考:30-55% 嘅重疊值得覆查;55% 以上(尤其係有幾個完全匹配嘅句子或者一段較長嘅逐字重複片段)就有真實風險令兩個頁面互相競爭或者蠶食彼此排名,或者其中一個俾人當係冇原創性。
如果我自己嘅兩個頁面分數好高,應該點做?
可以將內容做有意義嘅區分(唔同角度、更深入、唔同搜尋意圖)再互相連結,或者揀較強嘅嗰個頁面,將較弱嗰個 301 重定向或者設 canonical 指返去。發佈兩個幾乎一樣、爭緊同一個查詢詞嘅頁面,通常對兩者排名都冇乜幫助。
我而家喺度檢查轉載內容——重複係咪一定係壞事?
唔一定。只要 canonical 頁面清晰,搜尋引擎都可以好好處理合法嘅轉載內容——喺轉載副本上面用跨域嘅 rel="canonical" 標籤指返去原文,或者確保轉載夥伴有咁樣做。
呢個工具會唔會將我啲文字傳送去邊度?
兩段文字會經 HTTPS 傳送一次去我哋伺服器,以進行比較(要令匹配邏輯保持喺伺服器端先可以保證一致),請求完成之後就唔會被儲存。