Content SEO

Duplicate Content Checker

I-paste ang dalawang piraso ng text — draft laban sa na-publish na bersyon, ang artikulo mo laban sa kompetisyon, o ang page mo laban sa syndicated na kopya — at makita kung gaano sila katumpak na nag-o-overlap, pangungusap por pangungusap.

Ang pagtutugma ay base sa word-shingle (magkakasunod na sunod-sunod na salita), kaya gumagana ito sa anumang wikang Latin ang alpabeto. Ang mga wikang walang espasyo sa pagitan ng mga salita (hal. Chinese, Thai, Khmer) ay magbibigay ng mas magaspang na signal — ituring ang score bilang direksyon lang, hindi eksaktong bilang, para sa mga wikang iyon.

Ano ang sinusuri ng tool na ito

Maingat ang mga search engine sa mga page na malaki ang inuulit na content na na-index na sa ibang lugar — scraped man ito, syndicated nang walang credit, o lumang draft na hindi na na-rewrite. Sinusukat ng tool na ito ang aktwal na textual overlap sa pagitan ng dalawang dokumento: pangkalahatang similarity score, kung aling mga pangungusap ang word-for-word duplicate o malapit na paraphrase, at ang iisang pinakamahabang verbatim na parirala na parehong meron.

Paano kinakalkula ang score

Gumagamit ang engine ng w-shingling — parehong pamilya ng technique na ginagamit ng mga search engine at plagiarism tool para sa near-duplicate detection — sa halip na simpleng character diff, kaya nahuhuli pa rin kahit na na-reorder ang mga paragraph o may maliliit na pagbabago.

Document similarity (Jaccard sa shingles)

Parehong text ay hinahati sa magkakapatong na 6-word sequences ("shingles"). Ang Jaccard index — shared shingles hinati sa total unique shingles — ay nagbibigay ng pangkalahatang resemblance score na matatag kahit na-reorder ang mga paragraph.

Content overlap (containment)

Ang Jaccard lang ay maaaring mababa ang report kapag ang isang text ay mas maikli nang malaki kaysa sa isa (isang maikling quoted excerpt sa loob ng mahabang artikulo ay mababa ang Jaccard score kahit 100% ng excerpt ay kinopya). Sinusukat ng containment kung anong porsyento ng shingles ng mas maikling text ang lumilitaw sa mas mahabang isa, sa parehong direksyon, kaya nahuhuli ang ganitong kaso.

Sentence-level matching

Bawat pangungusap sa Text A ay ikinukumpara sa bawat pangungusap sa Text B gamit ang parehong shingle-overlap technique sa mas detalyadong antas, pagkatapos ay iku-classify bilang exact match, near-duplicate (paraphrase-level overlap), o natatangi.

Pinakamahabang verbatim run

Sa mga tumutugmang pares ng pangungusap, hinahanap ng tool ang pinakamahabang eksaktong magkakasunod na word-for-word sequence na parehong meron ang dalawang text — ang isang mahabang verbatim run ay mas malakas na signal ng duplicate content kaysa sa katamtamang pangkalahatang score.

Mga madalas itanong

Gaano karaming overlap ang binibilang na "duplicate content" ng Google?

Hindi kailanman naglabas ang Google ng eksaktong threshold, at ang near-duplicate detection ay isa lamang sa maraming signal. Bilang praktikal na gabay: ang overlap sa 30-55% ay dapat suriin, 55% pataas (lalo na kung may ilang exact-match na pangungusap o isang mahabang verbatim run) ay tunay na panganib na magkumpetensya o mag-cannibalize ang dalawang page sa isa't isa, o ang isa ay ituring na hindi orihinal.

Ano ang dapat kong gawin kung mataas ang score ng dalawa kong sariling page?

Alinman sa gawing makabuluhang naiiba ang content (ibang anggulo, mas malalim, ibang intent) at i-cross-link ang mga ito, o piliin ang mas malakas na page at gawing 301-redirect / canonical ang mas mahinang isa papunta dito. Ang paglalathala ng dalawang halos magkatulad na page na nagkukumpetensya sa parehong query ay bihirang makatulong sa alinman sa kanila na mag-rank.

Sinusuri ko ang syndicated content — palagi bang masama ang duplication?

Hindi. Maayos na hinahandle ng mga search engine ang lehitimong syndicated content basta malinaw ang canonical page — gamitin ang cross-domain na rel="canonical" tag na nakaturo sa orihinal sa syndicated copy, o tiyaking ginagawa ito ng syndication partner.

Ipinapadala ba ng tool na ito ang text ko kahit saan?

Ang parehong text ay ipinapadala nang isang beses, sa pamamagitan ng HTTPS, sa aming server para patakbuhin ang paghahambing (kinakailangan para manatiling server-side at consistent ang matching logic), at hindi na-store lampas sa request.