Technical SEO

Noindex là gì?

Định nghĩa nhanh

Noindex là chỉ thị khai báo qua thẻ meta robots hoặc HTTP header, yêu cầu công cụ tìm kiếm không lưu trang vào index. Trang cần được crawl được thì Google mới đọc thấy thẻ noindex, nên không nên kết hợp noindex với chặn crawl qua robots.txt.

Noindex là gì?

Noindex là một chỉ thị (directive) được khai báo qua thẻ meta robots trong HTML hoặc qua HTTP header X-Robots-Tag, yêu cầu công cụ tìm kiếm không lưu trang đó vào index. Trang có noindex sẽ không xuất hiện trong kết quả tìm kiếm, kể cả khi tìm chính xác tên trang.

Cú pháp khai báo noindex

<meta name="robots" content="noindex" />

Hoặc kết hợp với chỉ thị khác, ví dụ vẫn cho phép đi theo liên kết trong trang:

<meta name="robots" content="noindex, follow" />

Noindex hoạt động như thế nào?

Để Google thấy được thẻ noindex, trang đó bắt buộc phải được crawl được – đây là điểm rất quan trọng: nếu trang bị chặn crawl bởi robots.txt, Google không thể đọc được thẻ noindex bên trong HTML, dẫn đến kết quả trái ngược mong muốn (xem chi tiết ở phần sai lầm bên dưới).

Khi nào nên dùng noindex

  • Trang kết quả tìm kiếm nội bộ của website
  • Trang cảm ơn sau khi đặt hàng/đăng ký (thank-you page)
  • Trang lọc sản phẩm sinh ra quá nhiều biến thể trùng lặp gần như hoàn toàn
  • Trang tạm thời, trang test, trang staging
  • Trang phân trang sâu không còn giá trị SEO riêng

Noindex và Robots.txt khác nhau thế nào?

Noindex Robots.txt (Disallow)
Mục đích Ngăn trang xuất hiện trong index/kết quả tìm kiếm Ngăn bot crawl (đọc nội dung) trang
Điều kiện hoạt động Cần Google crawl được trang để thấy thẻ này Ngăn crawl từ đầu, Google không đọc được nội dung
Rủi ro dùng sai Vô tình để noindex trên trang quan trọng, mất index Chặn crawl trang cần noindex khiến Google không thấy thẻ noindex, trang vẫn có thể bị index (dạng không mô tả) nếu có backlink

Nguyên tắc quan trọng: không dùng cả hai cùng lúc cho cùng một trang muốn loại khỏi index – nếu chặn crawl bằng robots.txt, thẻ noindex bên trong sẽ không bao giờ được Google đọc thấy.

Noindex và Nofollow khác nhau thế nào?

Nofollow là thuộc tính áp dụng cho một liên kết cụ thể (báo hiệu không truyền tín hiệu qua liên kết đó), trong khi noindex áp dụng cho toàn bộ một trang (báo hiệu không lập chỉ mục trang đó). Hai khái niệm hoàn toàn khác phạm vi áp dụng dù đôi khi bị nhầm lẫn vì cùng nằm trong nhóm chỉ thị robots.

Cách kiểm tra một trang có bị noindex hay không

Dùng công cụ URL Inspection trong Google Search Console, hoặc xem trực tiếp mã nguồn HTML (View Page Source) tìm thẻ meta robots trong phần <head>.

Những sai lầm thường gặp

  • Chặn crawl bằng robots.txt cho trang có noindex – khiến Google không bao giờ đọc được thẻ noindex, có thể dẫn đến kết quả ngược lại mong muốn
  • Vô tình để noindex toàn site sau khi chuyển từ môi trường staging sang production mà quên gỡ bỏ – đây là một trong những sự cố SEO nghiêm trọng và phổ biến nhất
  • Dùng noindex cho trang vẫn muốn giữ trong XML Sitemap – gây tín hiệu mâu thuẫn, nên loại trang noindex khỏi sitemap

Ví dụ tình huống thực tế

Một sàn thương mại điện tử có tính năng lọc sản phẩm theo nhiều tiêu chí (màu sắc, giá, kích thước), sinh ra hàng chục nghìn URL tổ hợp gần như trùng lặp nội dung. Giải pháp: giữ lại vài tổ hợp lọc phổ biến, có search volume thực tế (VD: “áo thun nam màu đen”) ở trạng thái index bình thường vì có giá trị SEO riêng, còn lại toàn bộ các tổ hợp lọc ít giá trị (VD: kết hợp 5 bộ lọc cùng lúc) nên đặt noindex để tránh pha loãng và lãng phí crawl budget vào các URL không ai tìm kiếm.

Checklist trước khi thêm Noindex

  • Trang có đang nhận traffic organic thực tế không? Nếu có, cân nhắc kỹ trước khi noindex
  • Trang có đang bị chặn crawl bởi robots.txt không? Nếu có, cần gỡ chặn để Google đọc được thẻ noindex
  • Trang có đang nằm trong XML Sitemap không? Nếu có, nên loại khỏi sitemap khi đã thêm noindex
  • Có internal link nào trỏ tới trang này với kỳ vọng nó được index không? Nếu có, cần cân nhắc điều chỉnh

Câu hỏi thường gặp

Noindex có ảnh hưởng đến crawl budget không?

Có phần nào – vì Google vẫn cần crawl trang để thấy thẻ noindex, sau đó mới ngừng index. Với số lượng lớn trang noindex, cách hiệu quả hơn về lâu dài là cân nhắc gộp/xóa hẳn nếu trang không còn giá trị.

Bao lâu thì trang biến mất khỏi kết quả tìm kiếm sau khi thêm noindex?

Phụ thuộc vào tần suất Google crawl lại trang đó – có thể từ vài ngày đến vài tuần. Có thể dùng “Yêu cầu lập chỉ mục” trong Search Console để thúc đẩy Google crawl lại sớm hơn.

Nguồn tham khảo

Nguồn tham khảo