SEO เนื้อหา
Duplicate Content Checker
วางข้อความสองชิ้น — ฉบับร่างกับฉบับเผยแพร่ บทความของคุณกับของคู่แข่ง หรือหน้าของคุณกับสำเนาที่นำไปเผยแพร่ซ้ำ — แล้วดูว่าซ้ำซ้อนกันมากแค่ไหน ทีละประโยค
การจับคู่อิงจาก word-shingle (ลำดับคำต่อเนื่อง) จึงใช้ได้กับภาษาที่เขียนด้วยอักษรละตินทุกภาษา ส่วนภาษาที่เขียนโดยไม่มีช่องว่างระหว่างคำ (เช่น จีน ไทย เขมร) จะได้สัญญาณที่หยาบกว่า — ให้มองคะแนนเป็นแนวโน้ม ไม่ใช่ตัวเลขที่แม่นยำสำหรับภาษาเหล่านั้น
เครื่องมือนี้ตรวจอะไรบ้าง
เสิร์ชเอนจินระมัดระวังหน้าเว็บที่เนื้อหาซ้ำกับสิ่งที่ถูกจัดทำดัชนีไว้ที่อื่นอย่างมีนัยสำคัญ ไม่ว่าจะถูกดึงมา (scrape) นำไปเผยแพร่ซ้ำโดยไม่ให้เครดิต หรือเป็นฉบับร่างเก่าที่ไม่เคยเขียนใหม่ เครื่องมือนี้วัดความซ้ำซ้อนของข้อความจริงระหว่างสองเอกสาร ได้แก่ คะแนนความคล้ายโดยรวม ประโยคใดที่ตรงกันคำต่อคำหรือถอดความใกล้เคียง และวลีคำต่อคำที่ยาวที่สุดที่ทั้งสองมีร่วมกัน
คะแนนคำนวณอย่างไร
เอนจินนี้ใช้เทคนิค w-shingling ซึ่งอยู่ในกลุ่มเดียวกับที่เสิร์ชเอนจินและเครื่องมือตรวจการลอกเลียนใช้ตรวจจับเนื้อหาเกือบซ้ำ แทนที่จะเทียบตัวอักษรแบบตรงไปตรงมา จึงยังจับได้แม้ย่อหน้าถูกสลับลำดับหรือมีการแก้ไขเล็กน้อย
ความคล้ายของเอกสาร (ดัชนี Jaccard บน shingle)
ข้อความทั้งสองถูกแบ่งเป็นลำดับคำ 6 คำที่ซ้อนทับกัน ("shingle") ดัชนี Jaccard — จำนวน shingle ที่มีร่วมกันหารด้วยจำนวน shingle ที่ไม่ซ้ำทั้งหมด — ให้คะแนนความคล้ายโดยรวมที่ยังแม่นยำแม้ย่อหน้าถูกสลับลำดับ
ความซ้อนทับของเนื้อหา (containment)
Jaccard เพียงอย่างเดียวอาจรายงานต่ำเกินจริงเมื่อข้อความหนึ่งสั้นกว่าอีกข้อความมาก (ข้อความอ้างอิงสั้น ๆ ในบทความยาวจะได้คะแนน Jaccard ต่ำแม้จะถูกคัดลอกไป 100%) Containment วัดว่า shingle ของข้อความที่สั้นกว่ามีสัดส่วนเท่าใดที่ปรากฏในข้อความที่ยาวกว่า ทั้งสองทิศทาง จึงจับกรณีนี้ได้
การจับคู่ระดับประโยค
ทุกประโยคใน ข้อความ A จะถูกเทียบกับทุกประโยคใน ข้อความ B ด้วยเทคนิค shingle-overlap แบบเดียวกันในระดับที่ละเอียดขึ้น แล้วจัดประเภทเป็นตรงกันเป๊ะ เกือบซ้ำ (ระดับถอดความ) หรือไม่ซ้ำ
ลำดับคำต่อคำที่ยาวที่สุด
จากคู่ประโยคที่จับคู่ได้ เครื่องมือจะหาลำดับคำต่อเนื่องที่ตรงกันเป๊ะยาวที่สุดที่ทั้งสองข้อความมีร่วมกัน — ลำดับคำต่อคำที่ยาวเพียงจุดเดียวเป็นสัญญาณเนื้อหาซ้ำที่หนักแน่นกว่าคะแนนโดยรวมระดับปานกลาง
คำถามที่พบบ่อย
ความซ้อนทับเท่าไรถึงถูกนับเป็น "duplicate content" โดย Google?
Google ไม่เคยเผยแพร่เกณฑ์ที่แน่ชัด และการตรวจจับเนื้อหาเกือบซ้ำเป็นเพียงหนึ่งในหลายสัญญาณ แนวทางปฏิบัติคร่าว ๆ: ซ้อนทับ 30-55% ควรตรวจสอบ ส่วน 55% ขึ้นไป (โดยเฉพาะถ้ามีประโยคตรงเป๊ะหลายประโยคหรือมีลำดับคำต่อคำยาว ๆ หนึ่งจุด) ถือเป็นความเสี่ยงจริงที่ทั้งสองหน้าจะแย่งกันเองหรือกัดกินอันดับกันเอง หรือหน้าใดหน้าหนึ่งถูกมองว่าไม่มีความเป็นต้นฉบับ
ควรทำอย่างไรถ้าหน้าเว็บสองหน้าของตัวเองได้คะแนนสูง?
อาจปรับเนื้อหาให้แตกต่างกันอย่างมีนัยสำคัญ (มุมมองต่างกัน เจาะลึกกว่า เจตนาการค้นหาต่างกัน) แล้วลิงก์ถึงกัน หรือเลือกหน้าที่แข็งแรงกว่าแล้วทำ 301 redirect / ตั้ง canonical จากหน้าที่อ่อนกว่ามาที่หน้านั้น การเผยแพร่หน้าที่เกือบเหมือนกันสองหน้าเพื่อแย่งคำค้นเดียวกันมักไม่ช่วยให้หน้าไหนติดอันดับดีขึ้น
กำลังตรวจสอบเนื้อหาที่เผยแพร่ซ้ำ (syndicated) — ความซ้ำซ้อนแย่เสมอไปไหม?
ไม่เสมอไป เสิร์ชเอนจินจัดการเนื้อหาที่เผยแพร่ซ้ำอย่างถูกต้องได้ดี ตราบใดที่หน้า canonical ชัดเจน — ใช้แท็ก rel="canonical" ข้ามโดเมนชี้ไปยังต้นฉบับบนสำเนาที่เผยแพร่ซ้ำ หรือให้แน่ใจว่าคู่พันธมิตรที่เผยแพร่ซ้ำทำเช่นนั้น
เครื่องมือนี้ส่งข้อความของฉันไปที่ใดหรือไม่?
ข้อความทั้งสองจะถูกส่งครั้งเดียวผ่าน HTTPS ไปยังเซิร์ฟเวอร์ของเราเพื่อรันการเปรียบเทียบ (จำเป็นเพื่อให้ตรรกะการจับคู่อยู่ฝั่งเซิร์ฟเวอร์และสอดคล้องกัน) และจะไม่ถูกจัดเก็บหลังจากคำขอเสร็จสิ้น