SEO Kỹ Thuật

Công Cụ Kiểm Tra Quy Tắc Robots.txt

Dán file robots.txt, chọn một crawler, rồi kiểm tra bất kỳ đường dẫn nào. Xem chính xác quy tắc nào thắng, và phát hiện những lỗi âm thầm chặn công cụ tìm kiếm hoặc lãng phí crawl budget.

Chạy hoàn toàn trong trình duyệt của bạn. Không có gì bạn dán ở đây được gửi đi đâu cả, ngoại trừ số lượt sử dụng ẩn danh.

Dán chính xác nội dung file robots.txt của bạn.

Chỉ nhập đường dẫn và query string tùy chọn, không kèm domain, vd. /blog/post-1?ref=x.

Cách hoạt động, và cách sửa các lỗi thường gặp

Các crawler thật sự chọn một nhóm User-agent cụ thể nhất khớp với tên của chúng (khớp chính xác hoặc tiền tố dài nhất thắng "*"), sau đó, chỉ trong nhóm đó, áp dụng quy tắc Allow hoặc Disallow có mẫu đường dẫn khớp dài nhất, với Allow thắng khi hòa. Công cụ này chạy đúng thuật toán đó — chứ không chỉ tìm Disallow đầu tiên gặp được.

"*" bên trong một quy tắc khớp với bất kỳ chuỗi ký tự nào, và "$" ở cuối neo quy tắc vào cuối đường dẫn. Disallow: /*.pdf$ chặn /file.pdf nhưng không chặn /file.pdf?ref=1 — một nguyên nhân phổ biến khiến file PDF vẫn vô tình bị crawl.

Dòng "Disallow:" trống có nghĩa là không có hạn chế nào cả — nó không chặn bất cứ điều gì. Và một khi crawler khớp với một nhóm cụ thể (như "Googlebot"), các quy tắc dưới "User-agent: *" hoàn toàn bị bỏ qua đối với crawler đó; hai nhóm không bao giờ được gộp lại.

Các lỗi thường gặp mà công cụ này gắn cờ: Disallow: / còn sót lại từ trang staging (chặn toàn bộ), các quy tắc đặt trước bất kỳ dòng User-agent nào (bị bỏ qua âm thầm), Crawl-delay (bị Google và Bing bỏ qua), và URL Sitemap không phải dạng tuyệt đối.

📊 Trang này chính xác đến mức nào?

Chạm vào một biểu tượng để đánh giá — rồi xem mọi người nghĩ gì.

0%

Không thể lưu lượt bình chọn — vui lòng thử lại.

4