SEO ខ្លឹមសារ

Duplicate Content Checker

បិទភ្ជាប់អត្ថបទពីរ — សេចក្តីព្រាងធៀបនឹងកំណែដែលបានផ្សព្វផ្សាយ អត្ថបទរបស់អ្នកធៀបនឹងអត្ថបទគូប្រកួត ឬទំព័ររបស់អ្នកធៀបនឹងច្បាប់ចម្លងដែលបានផ្សព្វផ្សាយឡើងវិញ — ហើយមើលពិតប្រាកដថាតើវាត្រួតគ្នាប៉ុនណា ជាប្រយោគម្តងមួយៗ។

ការផ្គូផ្គងផ្អែកលើ word-shingle (លំដាប់ពាក្យជាប់ៗគ្នា) ដូច្នេះវាដំណើរការសម្រាប់ភាសាអក្សរឡាតាំងទាំងអស់។ ភាសាដែលសរសេរដោយគ្មានចន្លោះរវាងពាក្យ (ដូចជា ចិន ថៃ ខ្មែរ) នឹងទទួលបានសញ្ញាដែលមិនសូវច្បាស់លាស់ — សូមចាត់ទុកពិន្ទុជាទិសដៅ មិនមែនជាតួលេខច្បាស់លាស់សម្រាប់ភាសាទាំងនោះទេ។

អ្វីដែលឧបករណ៍នេះត្រួតពិនិត្យ

ម៉ាស៊ីនស្វែងរកប្រុងប្រយ័ត្នចំពោះទំព័រដែលធ្វើម្តងទៀតយ៉ាងច្រើននូវខ្លឹមសារដែលបានចាត់លិបិក្រមរួចហើយនៅកន្លែងផ្សេង — មិនថាវាត្រូវបានទាញយក ផ្សព្វផ្សាយឡើងវិញដោយគ្មានការដកស្រង់ប្រភព ឬសេចក្តីព្រាងចាស់ដែលមិនធ្លាប់ត្រូវបានសរសេរឡើងវិញ។ ឧបករណ៍នេះវាស់ស្ទង់ការត្រួតគ្នានៃអត្ថបទពិតប្រាកដរវាងឯកសារពីរ៖ ពិន្ទុភាពស្រដៀងគ្នាទាំងមូល ប្រយោគមួយណាដែលដូចគ្នាបេះបិទ ឬត្រូវបានសរសេរឡើងវិញយ៉ាងជិតស្និទ្ធ និងឃ្លាតាមពាក្យវែងបំផុតតែមួយដែលទាំងពីរមានរួម។

របៀបគណនាពិន្ទុ

ម៉ាស៊ីននេះប្រើបច្ចេកទេស w-shingling — បច្ចេកទេសប្រភេទដូចគ្នាដែលម៉ាស៊ីនស្វែងរក និងឧបករណ៍ការពារការចម្លងប្រើសម្រាប់ការរកឃើញភាពស្ទួនស្ទើរតែដូច — ជំនួសឱ្យការប្រៀបធៀបតួអក្សរធម្មតា ដូច្នេះកថាខណ្ឌដែលត្រូវបានផ្លាស់ប្តូរលំដាប់ ឬកែប្រែបន្តិចបន្តួច នៅតែត្រូវបានចាប់បាន។

ភាពស្រដៀងគ្នានៃឯកសារ (លិបិក្រម Jaccard លើ shingle)

អត្ថបទទាំងពីរត្រូវបានបំបែកទៅជាលំដាប់ពាក្យ ៦ ដែលត្រួតគ្នា ("shingle")។ លិបិក្រម Jaccard — ចំនួន shingle រួមចែកនឹងចំនួន shingle ពិសេសសរុប — ផ្តល់ពិន្ទុភាពស្រដៀងគ្នាទាំងមូលដែលនៅតែរឹងមាំ ទោះបីកថាខណ្ឌត្រូវបានផ្លាស់ប្តូរលំដាប់ក៏ដោយ។

ការត្រួតគ្នានៃខ្លឹមសារ (containment)

Jaccard តែម្នាក់ឯងអាចរាយការណ៍ទាបជាងការពិត នៅពេលអត្ថបទមួយខ្លីជាងអត្ថបទមួយទៀតច្រើន (សម្រង់ខ្លីនៅក្នុងអត្ថបទវែងទទួលបានពិន្ទុ Jaccard ទាប ទោះបីជា ១០០% នៃសម្រង់នោះត្រូវបានចម្លងក៏ដោយ)។ Containment វាស់ស្ទង់ថាតើភាគរយប៉ុន្មាននៃ shingle របស់អត្ថបទខ្លីជាងលេចឡើងនៅក្នុងអត្ថបទវែងជាង ក្នុងទិសដៅទាំងពីរ ដូច្នេះចាប់យកករណីនេះបាន។

ការផ្គូផ្គងកម្រិតប្រយោគ

ប្រយោគនីមួយៗនៅក្នុងអត្ថបទ A ត្រូវបានប្រៀបធៀបជាមួយប្រយោគនីមួយៗនៅក្នុងអត្ថបទ B ដោយប្រើបច្ចេកទេស shingle-overlap ដូចគ្នានៅកម្រិតលម្អិតជាង រួចត្រូវបានចាត់ថ្នាក់ថាដូចគ្នាបេះបិទ ស្ទួនស្ទើរតែដូច (ការត្រួតគ្នាកម្រិតការសរសេរឡើងវិញ) ឬតែមួយគត់។

ផ្នែកតាមពាក្យវែងបំផុត

ក្នុងចំណោមគូប្រយោគដែលផ្គូផ្គងគ្នា ឧបករណ៍នេះរកឃើញលំដាប់ពាក្យជាប់ៗគ្នាដែលដូចគ្នាបេះបិទដ៏វែងបំផុតដែលអត្ថបទទាំងពីរមានរួម — ផ្នែកតាមពាក្យវែងតែមួយគឺជាសញ្ញាខ្លឹមសារស្ទួនដ៏ខ្លាំងជាងពិន្ទុទាំងមូលកម្រិតមធ្យម។

សំណួរដែលសួរញឹកញាប់

ការត្រួតគ្នាប៉ុនណាដែលត្រូវបានចាត់ទុកជា "duplicate content" ដោយ Google?

Google មិនដែលបានផ្សព្វផ្សាយកម្រិតគោលច្បាស់លាស់ទេ ហើយការរកឃើញភាពស្ទួនស្ទើរតែដូចគឺជាសញ្ញាមួយក្នុងចំណោមសញ្ញាជាច្រើន។ ជាការណែនាំជាក់ស្តែង៖ ការត្រួតគ្នាចន្លោះ ៣០-៥៥% គួរតែពិនិត្យឡើងវិញ ចំណែក ៥៥% ឡើងទៅ (ជាពិសេសមានប្រយោគដូចគ្នាបេះបិទច្រើន ឬផ្នែកតាមពាក្យវែងមួយ) គឺជាហានិភ័យពិតប្រាកដដែលទំព័រទាំងពីរប្រកួតគ្នា ឬស៊ីចំណាត់ថ្នាក់គ្នាឯង ឬម្យ៉ាងទៀតត្រូវបានចាត់ទុកថាមិនមានលក្ខណៈដើម។

ខ្ញុំគួរធ្វើអ្វី បើទំព័ររបស់ខ្ញុំពីរទទួលបានពិន្ទុខ្ពស់?

អាចធ្វើឱ្យខ្លឹមសារខុសគ្នាយ៉ាងសំខាន់ (មុំមើលខុសគ្នា ស៊ីជម្រៅជាង ចេតនាស្វែងរកខុសគ្នា) រួចភ្ជាប់តំណឆ្លងគ្នា ឬជ្រើសរើសទំព័រដែលរឹងមាំជាង ហើយធ្វើ 301 redirect / canonical ពីទំព័រដែលខ្សោយជាងទៅទំព័រនោះ។ ការផ្សព្វផ្សាយទំព័រពីរដែលស្ទើរតែដូចគ្នាដើម្បីប្រកួតប្រជែងសម្រាប់ពាក្យស្វែងរកតែមួយ កម្រនឹងជួយចំណាត់ថ្នាក់ណាមួយឡើយ។

ខ្ញុំកំពុងត្រួតពិនិត្យខ្លឹមសារដែលបានផ្សព្វផ្សាយឡើងវិញ — តើការស្ទួនតែងតែអាក្រក់ដែរឬទេ?

ទេទេ។ ម៉ាស៊ីនស្វែងរកដោះស្រាយខ្លឹមសារដែលបានផ្សព្វផ្សាយឡើងវិញយ៉ាងស្របច្បាប់បានល្អ ដរាបណាទំព័រ canonical ច្បាស់លាស់ — ប្រើស្លាក rel="canonical" ឆ្លងដែនដែលចង្អុលទៅច្បាប់ដើមនៅលើច្បាប់ចម្លងដែលបានផ្សព្វផ្សាយឡើងវិញ ឬធានាថាដៃគូផ្សព្វផ្សាយធ្វើដូច្នេះ។

តើឧបករណ៍នេះផ្ញើអត្ថបទរបស់ខ្ញុំទៅកន្លែងណាដែរឬទេ?

អត្ថបទទាំងពីរត្រូវបានផ្ញើម្តងតាមរយៈ HTTPS ទៅម៉ាស៊ីនមេរបស់យើងដើម្បីដំណើរការការប្រៀបធៀប (ត្រូវការដើម្បីរក្សាតក្កវិជ្ជាផ្គូផ្គងនៅផ្នែកម៉ាស៊ីនមេ និងស៊ីសង្វាក់គ្នា) ហើយមិនត្រូវបានរក្សាទុកលើសពីសំណើនោះទេ។