कंटेंट SEO
Duplicate Content Checker
दो टेक्स्ट पेस्ट करें — ड्राफ्ट बनाम प्रकाशित वर्शन, आपका लेख बनाम प्रतिस्पर्धी का लेख, या आपका पेज बनाम सिंडिकेटेड कॉपी — और देखें कि वाक्य-दर-वाक्य वास्तव में कितना ओवरलैप है।
मिलान वर्ड-शिंगल (लगातार शब्द अनुक्रम) पर आधारित है, इसलिए यह किसी भी लैटिन-लिपि भाषा के लिए काम करता है। जिन भाषाओं में शब्दों के बीच स्पेस नहीं होता (जैसे चीनी, थाई, खमेर), उनके लिए संकेत अधिक अस्पष्ट होगा — उन भाषाओं के लिए स्कोर को सटीक संख्या के बजाय दिशा-सूचक मानें।
यह टूल क्या जाँचता है
सर्च इंजन उन पेजों को लेकर सतर्क रहते हैं जो कहीं और पहले से इंडेक्स किए गए कंटेंट को काफी हद तक दोहराते हैं — चाहे वह स्क्रैप किया गया हो, बिना क्रेडिट के सिंडिकेट किया गया हो, या कोई पुराना ड्राफ्ट हो जिसे कभी दोबारा नहीं लिखा गया। यह टूल दो दस्तावेज़ों के बीच वास्तविक टेक्स्ट ओवरलैप मापता है: एक समग्र समानता स्कोर, कौन-से वाक्य शब्दशः डुप्लिकेट हैं या करीबी पैराफ्रेज़ हैं, और दोनों में साझा सबसे लंबा शब्दशः वाक्यांश।
स्कोर की गणना कैसे होती है
यह इंजन w-shingling का उपयोग करता है — यह वही तकनीक-परिवार है जिसका उपयोग सर्च इंजन और प्लेजियरिज़्म टूल नियर-डुप्लिकेट डिटेक्शन के लिए करते हैं — न कि केवल एक साधारण कैरेक्टर डिफ, इसलिए पैराग्राफ का क्रम बदलने या मामूली संपादन के बावजूद भी यह पकड़ में आ जाता है।
दस्तावेज़ समानता (शिंगल्स पर Jaccard)
दोनों टेक्स्ट को ओवरलैपिंग 6-शब्द अनुक्रमों ("शिंगल्स") में विभाजित किया जाता है। Jaccard इंडेक्स — साझा शिंगल्स को कुल यूनीक शिंगल्स से भाग देकर — एक समग्र समानता स्कोर देता है जो पैराग्राफ के क्रम बदलने पर भी स्थिर रहता है।
कंटेंट ओवरलैप (containment)
जब एक टेक्स्ट दूसरे की तुलना में बहुत छोटा होता है, तो अकेला Jaccard कम रिपोर्ट कर सकता है (एक लंबे लेख के भीतर एक छोटा उद्धृत अंश, भले ही 100% कॉपी किया गया हो, कम Jaccard स्कोर देता है)। Containment मापता है कि छोटे टेक्स्ट के कितने प्रतिशत शिंगल्स लंबे टेक्स्ट में दोनों दिशाओं में दिखाई देते हैं, जिससे यह मामला पकड़ में आता है।
वाक्य-स्तरीय मिलान
टेक्स्ट A के हर वाक्य की तुलना टेक्स्ट B के हर वाक्य से उसी शिंगल-ओवरलैप तकनीक से, अधिक बारीक स्तर पर की जाती है, फिर उसे सटीक मिलान, लगभग-डुप्लिकेट (पैराफ्रेज़-स्तरीय ओवरलैप), या यूनीक के रूप में वर्गीकृत किया जाता है।
सबसे लंबा शब्दशः क्रम
मिलान किए गए वाक्य जोड़ों में से, यह टूल दोनों टेक्स्ट में साझा सबसे लंबा लगातार शब्दशः मेल खाता क्रम खोजता है — एक लंबा शब्दशः क्रम एक मध्यम समग्र स्कोर की तुलना में डुप्लिकेट कंटेंट का कहीं अधिक मज़बूत संकेत है।
अक्सर पूछे जाने वाले प्रश्न
Google के लिए कितना ओवरलैप "डुप्लिकेट कंटेंट" माना जाता है?
Google ने कभी कोई सटीक सीमा प्रकाशित नहीं की है, और नियर-डुप्लिकेट डिटेक्शन कई संकेतों में से एक मात्र है। एक व्यावहारिक मार्गदर्शिका के रूप में: 30-55% रेंज का ओवरलैप समीक्षा के लायक है, 55% और उससे अधिक (विशेष रूप से कई सटीक-मिलान वाले वाक्यों या एक लंबे शब्दशः क्रम के साथ) दोनों पेजों के आपस में प्रतिस्पर्धा करने या एक-दूसरे की रैंकिंग खाने, या किसी एक को गैर-मौलिक माने जाने का वास्तविक जोखिम है।
अगर मेरे अपने दो पेज उच्च स्कोर करते हैं तो मुझे क्या करना चाहिए?
या तो कंटेंट को सार्थक रूप से अलग करें (अलग एंगल, अधिक गहराई, अलग इंटेंट) और उन्हें क्रॉस-लिंक करें, या मज़बूत पेज चुनें और कमज़ोर पेज को उसकी ओर 301-रीडायरेक्ट / canonical करें। एक ही क्वेरी के लिए प्रतिस्पर्धा करने वाले लगभग समान दो पेज प्रकाशित करना शायद ही किसी एक को रैंक करने में मदद करता है।
मैं सिंडिकेटेड कंटेंट जाँच रहा हूँ — क्या डुप्लिकेशन हमेशा बुरा होता है?
नहीं। जब तक canonical पेज स्पष्ट है, सर्च इंजन वैध रूप से सिंडिकेट किए गए कंटेंट को अच्छी तरह संभालते हैं — सिंडिकेटेड कॉपी पर मूल पेज की ओर इशारा करते हुए एक क्रॉस-डोमेन rel="canonical" टैग का उपयोग करें, या सुनिश्चित करें कि सिंडिकेशन पार्टनर ऐसा करता है।
क्या यह टूल मेरे टेक्स्ट को कहीं भेजता है?
दोनों टेक्स्ट तुलना चलाने के लिए HTTPS के ज़रिए हमारे सर्वर को एक बार भेजे जाते हैं (मिलान लॉजिक को सर्वर-साइड और सुसंगत रखने के लिए आवश्यक), और अनुरोध के बाद इन्हें संग्रहीत नहीं किया जाता।