SEO nội dung

Duplicate Content Checker

Dán hai đoạn văn bản — bản nháp so với bản đã xuất bản, bài viết của bạn so với đối thủ, hoặc trang của bạn so với bản sao được đăng lại — để xem chính xác chúng trùng nhau bao nhiêu, theo từng câu.

Việc so khớp dựa trên word-shingle (chuỗi từ liên tiếp), nên hoạt động với mọi ngôn ngữ dùng chữ Latinh. Các ngôn ngữ viết không có khoảng trắng giữa các từ (như tiếng Trung, Thái, Khmer) sẽ cho tín hiệu thô hơn — hãy xem điểm số như một chỉ dấu định hướng chứ không phải con số chính xác đối với các ngôn ngữ đó.

Công cụ này kiểm tra gì

Các công cụ tìm kiếm cảnh giác với những trang lặp lại đáng kể nội dung đã được lập chỉ mục ở nơi khác — dù là bị cào (scrape), đăng lại (syndicated) mà không ghi nguồn, hay một bản nháp cũ chưa từng được viết lại. Công cụ này đo mức độ trùng lặp văn bản thực sự giữa hai tài liệu: điểm tương đồng tổng thể, câu nào trùng khớp từng chữ hoặc được diễn đạt lại gần giống, và cụm từ nguyên văn dài nhất mà cả hai cùng có.

Cách tính điểm

Công cụ sử dụng kỹ thuật w-shingling — cùng họ kỹ thuật mà các công cụ tìm kiếm và phần mềm chống đạo văn dùng để phát hiện gần trùng lặp — thay vì so sánh ký tự đơn thuần, nên vẫn phát hiện được ngay cả khi đoạn văn bị đảo thứ tự hoặc chỉnh sửa nhỏ.

Độ tương đồng tài liệu (chỉ số Jaccard trên shingle)

Cả hai văn bản được chia thành các chuỗi 6 từ chồng lấp nhau ("shingle"). Chỉ số Jaccard — số shingle chung chia cho tổng số shingle duy nhất — cho điểm tương đồng tổng thể vẫn ổn định ngay cả khi đoạn văn bị đảo thứ tự.

Mức độ trùng lặp nội dung (containment)

Chỉ riêng Jaccard sẽ báo thấp hơn thực tế khi một văn bản ngắn hơn nhiều so với văn bản kia (một đoạn trích ngắn trong bài viết dài vẫn cho điểm Jaccard thấp dù 100% đoạn trích đó bị sao chép). Containment đo tỷ lệ shingle của văn bản ngắn hơn xuất hiện trong văn bản dài hơn, theo cả hai chiều, nên bắt được trường hợp này.

So khớp cấp độ câu

Mỗi câu trong Văn bản A được so sánh với mọi câu trong Văn bản B bằng cùng kỹ thuật shingle-overlap ở mức chi tiết hơn, sau đó được phân loại là trùng khớp hoàn toàn, gần trùng lặp (trùng ở mức diễn đạt lại), hoặc độc nhất.

Đoạn nguyên văn dài nhất

Trong số các cặp câu khớp nhau, công cụ tìm ra chuỗi từ liên tiếp trùng khớp chính xác dài nhất mà hai văn bản cùng có — một đoạn nguyên văn dài là tín hiệu trùng lặp nội dung mạnh hơn nhiều so với điểm tổng thể ở mức trung bình.

Câu hỏi thường gặp

Trùng lặp bao nhiêu thì bị Google coi là "duplicate content"?

Google chưa từng công bố ngưỡng chính xác, và việc phát hiện gần trùng lặp chỉ là một trong nhiều tín hiệu. Hướng dẫn thực tế: mức trùng lặp 30-55% đáng để xem xét lại; từ 55% trở lên (đặc biệt nếu có nhiều câu trùng khớp hoàn toàn hoặc một đoạn nguyên văn dài) là rủi ro thực sự khiến hai trang cạnh tranh hoặc ăn lẫn thứ hạng của nhau, hoặc một trong hai bị xem là thiếu tính nguyên bản.

Tôi nên làm gì nếu hai trang của chính mình có điểm cao?

Hoặc làm cho nội dung khác biệt một cách có ý nghĩa (góc nhìn khác, sâu hơn, mục đích tìm kiếm khác) rồi liên kết chéo chúng, hoặc chọn trang mạnh hơn và redirect 301 / đặt canonical từ trang yếu hơn trỏ về đó. Xuất bản hai trang gần như giống hệt nhau để cạnh tranh cùng một truy vấn hiếm khi giúp trang nào xếp hạng tốt hơn.

Tôi đang kiểm tra nội dung được đăng lại (syndicated) — trùng lặp có luôn xấu không?

Không. Các công cụ tìm kiếm xử lý tốt nội dung đăng lại hợp pháp miễn là trang canonical rõ ràng — dùng thẻ rel="canonical" liên miền trỏ về bản gốc trên bản sao được đăng lại, hoặc đảm bảo đối tác đăng lại làm điều đó.

Công cụ này có gửi văn bản của tôi đi đâu không?

Cả hai văn bản được gửi một lần, qua HTTPS, đến máy chủ của chúng tôi để thực hiện so sánh (cần thiết để giữ logic so khớp ở phía máy chủ và nhất quán), và không được lưu trữ sau khi yêu cầu hoàn tất.