Bỏ qua đến nội dung
Hotline: 0346 844 259 info@w3seo.com 46/1/56 Vườn Chuối, Phường 04, Quận 03, Thành phố Hồ Chí Minh

Noindex, Nofollow & Disallow: Cách Sử Dụng Đúng Chuẩn Trong SEO

Thời lượng8 phútCập nhật 05/08/2026
chăm sóc website

Noindex, nofollow và Disallow giải quyết ba vấn đề khác nhau: noindex kiểm soát việc một URL có xuất hiện trong kết quả tìm kiếm hay không; nofollow và các giá trị liên quan mô tả cách công cụ tìm kiếm xử lý liên kết; còn Disallow trong robots.txt kiểm soát việc bot có được phép yêu cầu một URL hay không.

Dùng nhầm ba chỉ thị này có thể khiến Google không đọc được thẻ noindex, bỏ sót nội dung quan trọng hoặc tiếp tục hiển thị một URL dù bạn đã chặn crawl. Bài viết này trình bày cách chọn đúng công cụ, triển khai và kiểm tra theo tài liệu Google Search Central hiện hành.

Câu trả lời nhanh

  • Muốn URL không xuất hiện trên Google: dùng noindex và vẫn cho phép Google crawl URL.
  • Muốn kiểm soát một liên kết trả phí hoặc do người dùng tạo: dùng rel="sponsored", rel="ugc" hoặc rel="nofollow" phù hợp.
  • Muốn hạn chế bot crawl một đường dẫn: dùng Disallow trong robots.txt.
  • Muốn bảo vệ dữ liệu riêng tư: dùng đăng nhập, phân quyền hoặc biện pháp bảo mật; robots.txt không phải lớp bảo mật.

So sánh Noindex, Nofollow và Disallow

Chỉ thịMục đích chínhĐặt ở đâu?Có chặn index không?
noindexYêu cầu không đưa URL vào kết quả tìm kiếmMeta robots hoặc HTTP X-Robots-TagCó, sau khi bot crawl và xử lý chỉ thị
nofollowMô tả cách xử lý liên kết trên trang hoặc một liên kết cụ thểMeta robots hoặc thuộc tính rel của liên kếtKhông
DisallowHạn chế bot yêu cầu URLrobots.txtKhông bảo đảm; URL vẫn có thể được biết đến từ nguồn khác

Điểm dễ nhầm nhất là crawl và index không phải một việc. Robots.txt điều khiển crawl. Meta robots và X-Robots-Tag điều khiển index hoặc cách hiển thị sau khi bot truy cập được tài nguyên.

Noindex là gì?

noindex là chỉ thị yêu cầu công cụ tìm kiếm không hiển thị một tài nguyên trong kết quả tìm kiếm. Với trang HTML, cách phổ biến là đặt meta robots trong phần <head>:

<meta name="robots" content="noindex">

Với PDF, hình ảnh hoặc tài nguyên không phải HTML, có thể dùng HTTP header:

X-Robots-Tag: noindex

Google phải crawl được URL để đọc meta robots hoặc X-Robots-Tag. Vì vậy, không nên đồng thời chặn URL bằng robots.txt rồi kỳ vọng Google đọc được noindex trên chính URL đó.

Khi nào nên dùng noindex?

  • Trang cảm ơn hoặc trang xác nhận không có search task công khai.
  • Trang đăng nhập, tài khoản hoặc khu vực quản trị vẫn truy cập công khai nhưng không cần xuất hiện trên tìm kiếm.
  • Kết quả tìm kiếm nội bộ hoặc trang lọc tạo ra nhiều URL không có giá trị độc lập.
  • Trang tạm thời chưa sẵn sàng xuất hiện trên tìm kiếm.
  • Tài liệu PDF hoặc file công khai nhưng không muốn xuất hiện trong kết quả tìm kiếm.

Không nên noindex một trang chỉ vì trang đó chưa có traffic. Trước khi loại khỏi index, cần xác định search task, chất lượng nội dung, internal link, canonical và khả năng hợp nhất với URL khác.

Noindex không phải công cụ bảo mật

Một URL noindex vẫn có thể được truy cập trực tiếp. Nếu nội dung chứa dữ liệu riêng tư, hãy dùng xác thực, phân quyền, mật khẩu hoặc hạn chế truy cập ở máy chủ. Không dựa vào meta robots hay robots.txt để bảo vệ thông tin nhạy cảm.

Nofollow, sponsored và ugc khác nhau thế nào?

nofollow là một giá trị thuộc tính rel dùng khi bạn không muốn gắn sự chứng thực thông thường cho một liên kết. Google xử lý các thuộc tính này như tín hiệu, không phải cơ chế bảo mật hoặc bảo đảm URL đích sẽ không được crawl.

<a href="https://example.com" rel="nofollow">Liên kết tham khảo</a>

Với liên kết trả phí, quảng cáo hoặc tài trợ, ưu tiên:

<a href="https://example.com" rel="sponsored">Đối tác tài trợ</a>

Với liên kết do người dùng tạo trong bình luận hoặc diễn đàn, có thể dùng:

<a href="https://example.com" rel="ugc">Liên kết do người dùng đăng</a>

Có thể kết hợp nhiều giá trị khi cần, ví dụ rel="ugc nofollow".

Có nên nofollow liên kết nội bộ?

Thông thường không. Liên kết nội bộ giúp công cụ tìm kiếm khám phá URL, hiểu cấu trúc website và mối quan hệ giữa các trang. Không nên dùng nofollow để “điêu khắc PageRank” hoặc ngăn một trang nội bộ được index. Nếu một URL không nên xuất hiện trên tìm kiếm, hãy dùng cơ chế phù hợp như noindex, canonical, redirect hoặc loại bỏ URL tùy trường hợp.

Disallow trong robots.txt là gì?

Disallow là quy tắc trong robots.txt dùng để yêu cầu crawler không truy cập một đường dẫn nhất định.

User-agent: *
Disallow: /private-path/

Robots.txt là tệp công khai. Bất kỳ ai cũng có thể mở tệp và xem các đường dẫn bị chặn. Vì vậy, không đưa đường dẫn bí mật vào robots.txt với kỳ vọng chúng được bảo vệ.

Khi nào nên dùng Disallow?

  • Hạn chế crawl các URL lọc hoặc tham số tạo số lượng rất lớn nhưng không cần bot truy cập.
  • Hạn chế crawler truy cập khu vực quản trị hoặc đường dẫn kỹ thuật không phục vụ tìm kiếm.
  • Giảm crawl lãng phí trong một hệ thống lớn sau khi đã phân tích log và xác định vấn đề thực tế.
  • Chặn một crawler cụ thể theo user-agent khi có lý do vận hành phù hợp.

Không nên chặn CSS, JavaScript hoặc hình ảnh quan trọng chỉ để “tiết kiệm crawl”. Google cần các tài nguyên cần thiết để render và hiểu nội dung. Với phần lớn website nhỏ và vừa, tối ưu kiến trúc URL, internal link, sitemap và chất lượng nội dung thường quan trọng hơn việc cố điều khiển crawl budget bằng robots.txt.

Không kết hợp Noindex và Disallow theo cách khiến Google không đọc được chỉ thị

Một lỗi phổ biến là đặt noindex trong HTML rồi đồng thời chặn URL bằng robots.txt. Khi Google không được phép crawl, hệ thống có thể không đọc được meta robots. URL vẫn có khả năng xuất hiện dưới dạng kết quả chỉ có địa chỉ nếu được phát hiện qua liên kết hoặc sitemap.

Quy trình an toàn khi muốn loại một URL khỏi Google:

  1. Đảm bảo URL trả về HTTP 200 và Google có thể crawl.
  2. Thêm meta robots hoặc X-Robots-Tag noindex.
  3. Loại URL khỏi XML sitemap nếu URL không còn là trang indexable mong muốn.
  4. Kiểm tra bằng URL Inspection và báo cáo Page Indexing.
  5. Nếu cần ẩn khẩn cấp khỏi kết quả tìm kiếm, có thể dùng Removals trong Search Console như biện pháp tạm thời; vẫn phải triển khai giải pháp lâu dài.

Cách kiểm tra Noindex, Nofollow và Disallow

Kiểm tra noindex

  1. Mở source hoặc DevTools để kiểm tra meta robots trong HTML gốc.
  2. Kiểm tra HTTP header để tìm X-Robots-Tag.
  3. Dùng URL Inspection để xem HTML Googlebot nhận được và trạng thái index hiện tại.
  4. Dùng crawler như Screaming Frog để rà hàng loạt URL noindex ngoài ý muốn.

Toán tử site: chỉ nên dùng như tín hiệu tham khảo. Không có kết quả từ lệnh site không đủ để kết luận một URL đã được noindex; URL Inspection đáng tin cậy hơn cho chẩn đoán từng URL.

Kiểm tra nofollow, sponsored và ugc

Mở source hoặc Inspect Element và kiểm tra thuộc tính rel trên liên kết. Với audit hàng loạt, dùng crawler để lọc liên kết theo từng giá trị. Không dùng báo cáo Links trong Search Console để kết luận một liên kết cụ thể có rel gì.

Kiểm tra Disallow

  1. Mở trực tiếp /robots.txt và xác định user-agent áp dụng.
  2. Dùng URL Inspection hoặc crawler để xác định URL có bị robots.txt chặn hay không.
  3. Kiểm tra cả desktop và mobile user-agent khi hệ thống có quy tắc riêng.
  4. Sau khi sửa robots.txt, crawl lại các URL quan trọng và theo dõi Page Indexing.

Bảng chọn chỉ thị theo tình huống

Tình huốngCách xử lý thường phù hợp
Trang cảm ơn không cần xuất hiện trên Googlenoindex, vẫn cho phép crawl
PDF công khai nhưng không muốn xuất hiện trên GoogleX-Robots-Tag: noindex
Liên kết quảng cáo hoặc tài trợrel="sponsored"
Liên kết trong bình luận do người dùng đăngrel="ugc", có thể kết hợp nofollow
URL lọc tạo crawl lãng phí quy mô lớnXem xét robots.txt sau khi phân tích; đồng thời xử lý internal link và tham số
Dữ liệu riêng tưĐăng nhập, phân quyền hoặc chặn truy cập ở máy chủ
URL đã chuyển vĩnh viễn sang trang khácRedirect 301 đến URL phù hợp
Nội dung trùng nhưng cần giữ nhiều URLXem xét canonical; không dùng noindex như giải pháp mặc định

Sai lầm thường gặp

  • Dùng robots.txt để noindex một URL.
  • Chặn crawl trước khi Google đọc được thẻ noindex.
  • Dùng nofollow cho toàn bộ liên kết nội bộ.
  • Dùng nofollow thay cho sponsored đối với quảng cáo mà không có lý do.
  • Chặn CSS và JavaScript cần thiết cho render.
  • Dựa hoàn toàn vào toán tử site để kiểm tra index.
  • Dùng noindex hoặc robots.txt để bảo vệ dữ liệu riêng tư.

Nguồn chính thức nên tham khảo

Xem thêm hướng dẫn nền tảng tại Technical SEO là gì và kiểm tra cấu trúc website bằng hướng dẫn internal link.

Kết luận

Hãy chọn chỉ thị theo đúng vấn đề cần giải quyết: dùng noindex để kiểm soát index, dùng thuộc tính rel để mô tả liên kết và dùng Disallow để kiểm soát crawl. Khi cần loại URL khỏi Google, điều quan trọng nhất là để Google truy cập được URL và đọc được chỉ thị noindex; không chặn crawl rồi kỳ vọng noindex vẫn được xử lý.