Technical SEO

Googlebot là gì?

Định nghĩa nhanh

Googlebot là tên gọi chung cho các trình thu thập dữ liệu (crawler) chính thức mà Google Tìm kiếm dùng để tải và phân tích nội dung website, gồm hai loại chính: Googlebot Smartphone và Googlebot Desktop. Phần lớn website được crawl chủ yếu bởi phiên bản Smartphone do Google ưu tiên lập chỉ mục theo nội dung di động. Xác minh một request có đúng là Googlebot thật hay không cần dựa vào reverse DNS lookup hoặc đối chiếu dải IP chính thức, không chỉ dựa vào chuỗi User-Agent.

Googlebot là gì?

Googlebot là tên gọi chung cho các trình thu thập dữ liệu (crawler) mà Google Tìm kiếm dùng để tải và phân tích nội dung trang web. Theo tài liệu chính thức của Google Search Central, Googlebot thực chất gồm hai loại: Googlebot Smartphone (mô phỏng người dùng trên thiết bị di động) và Googlebot Desktop (mô phỏng người dùng trên máy tính). Cả hai dùng chung một mã sản phẩm (product token) trong robots.txt, nên quản trị viên không thể chặn riêng từng loại qua tệp này.

Vì phần lớn website hiện nay được Google lập chỉ mục theo phiên bản di động trước (mobile-first indexing), đa số lượt crawl thực tế đến từ Googlebot Smartphone, chỉ một phần nhỏ còn lại dùng Googlebot Desktop.

Cách Googlebot hoạt động

Googlebot không “đọc” cả website cùng lúc. Nó hoạt động theo một vòng lặp gồm ba bước: phát hiện URL (thường qua liên kết từ các trang đã thu thập trước đó, hoặc qua sitemap), gửi yêu cầu HTTP để tải nội dung, rồi chuyển dữ liệu sang hệ thống lập chỉ mục (Index) để xử lý tiếp.

Một vài đặc điểm kỹ thuật đáng chú ý, theo tài liệu chính thức:

  • Giới hạn dung lượng tải: Googlebot chỉ tải 2 MB đầu tiên của một tệp thuộc định dạng được hỗ trợ (riêng PDF là 64 MB). Mỗi tài nguyên được tham chiếu trong HTML — như file CSS hay JavaScript — cũng được tải riêng và áp dụng giới hạn tương tự. Nếu vượt giới hạn, Googlebot chỉ xét phần đã tải được để lập chỉ mục.
  • Múi giờ: khi crawl qua các dải IP đặt tại Mỹ, Googlebot hoạt động theo giờ Thái Bình Dương (Pacific Time) — một chi tiết nhỏ nhưng hữu ích khi đối chiếu log file server.
  • Tốc độ truy cập: với hầu hết site, Googlebot không gửi nhiều yêu cầu trong vài giây; nếu server phản hồi chậm hoặc lỗi nhiều, Google sẽ tự động giảm tốc độ crawl để tránh gây quá tải — đây chính là cơ chế liên quan trực tiếp đến khái niệm Crawl Budget.

Crawl và Index là hai việc khác nhau

Một hiểu lầm rất phổ biến: chặn Googlebot thu thập dữ liệu (crawl) không đồng nghĩa với việc trang sẽ biến mất khỏi kết quả tìm kiếm. Google phân biệt rõ hai cơ chế:

Mục tiêu Cách thực hiện
Ngăn Googlebot crawl trang Dùng robots.txt
Không muốn trang xuất hiện trên Google Dùng thẻ noindex
Chặn cả crawler lẫn người dùng truy cập Bảo vệ bằng mật khẩu hoặc xác thực khác

Vì sao có sự khác biệt này? Nếu một trang bị chặn trong robots.txt nhưng vẫn được liên kết từ nơi khác trên web, Google có thể vẫn biết đến URL đó (qua anchor text của liên kết trỏ tới) và hiển thị nó trong kết quả tìm kiếm mà không có mô tả — vì Googlebot chưa bao giờ được phép tải nội dung để đọc. Đây là lý do robots.txt không phải là công cụ để “giấu” một trang khỏi Google.

Cách xác minh một request có đúng là Googlebot thật

User-Agent trong HTTP header (ví dụ chuỗi chứa “Googlebot”) rất dễ bị giả mạo bởi các crawler khác hoặc bot xấu. Theo khuyến nghị chính thức, cách xác minh đáng tin cậy là:

  1. Thực hiện reverse DNS lookup trên địa chỉ IP gửi request, kiểm tra tên miền trả về có thuộc googlebot.com hoặc google.com hay không.
  2. Hoặc đối chiếu IP nguồn với danh sách dải IP chính thức của Googlebot mà Google công bố công khai.

Chỉ dựa vào chuỗi User-Agent trong log file là không đủ để kết luận một request có thực sự đến từ Google hay không.

Vì sao Googlebot quan trọng với SEO

Toàn bộ chuỗi giá trị SEO — từ việc trang có được lập chỉ mục, có xuất hiện trên SERP hay không, đến việc có nhận được organic traffic — đều bắt đầu từ việc Googlebot crawl được trang thành công. Nếu Googlebot không truy cập được (do lỗi server, chặn nhầm trong robots.txt, hoặc yêu cầu xác thực), mọi nỗ lực tối ưu nội dung phía sau đều vô nghĩa vì Google chưa từng “nhìn thấy” nội dung đó.

Sai lầm thường gặp khi làm việc với Googlebot

  • Chặn nhầm tài nguyên CSS/JS trong robots.txt — khiến Googlebot không render đúng giao diện trang, ảnh hưởng đến đánh giá trải nghiệm và nội dung.
  • Nhầm lẫn robots.txt với noindex — chặn crawl một trang đã lỡ được index từ trước sẽ khiến Google không thể đọc lại để thấy thẻ noindex mới thêm, trang vẫn có thể tồn tại trên kết quả tìm kiếm.
  • Tin vào User-Agent trong log mà không xác minh IP — dễ bị đánh lừa bởi bot giả mạo, dẫn đến quyết định chặn/không chặn sai.
  • Không theo dõi báo cáo Crawl Stats trong Google Search Console — bỏ lỡ dấu hiệu server đang phản hồi chậm hoặc lỗi, khiến Google tự giảm tần suất crawl.

Checklist kiểm tra nhanh

  • Robots.txt có vô tình chặn CSS/JS hoặc thư mục quan trọng không?
  • Server có phản hồi ổn định, ít lỗi 5xx khi Googlebot truy cập không?
  • Đã dùng công cụ kiểm tra IP/reverse DNS khi nghi ngờ bot giả mạo chưa?
  • Sitemap XML đã được khai báo để hỗ trợ Googlebot phát hiện URL mới nhanh hơn chưa?

Googlebot khác gì với các crawler AI mới xuất hiện gần đây?

Từ khi các công ty AI bắt đầu thu thập dữ liệu web để huấn luyện mô hình ngôn ngữ, nhiều quản trị viên nhầm lẫn Googlebot với các crawler AI như GPTBot (OpenAI) hay Google-Extended (crawler riêng của Google dùng cho việc huấn luyện Gemini và các tính năng AI, tách biệt hoàn toàn khỏi Googlebot Tìm kiếm). Đây là điểm quan trọng: chặn Google-Extended trong robots.txt không ảnh hưởng đến khả năng trang được Googlebot crawl và xếp hạng trên Google Tìm kiếm bình thường, vì hai user-agent này phục vụ hai mục đích khác nhau và được kiểm soát độc lập.

Câu hỏi thường gặp

Googlebot có phải là bot duy nhất của Google không?

Không. Google còn có các crawler chuyên biệt khác như Googlebot Image, Googlebot Video, hay AdsBot, mỗi loại có giới hạn kỹ thuật riêng (ví dụ giới hạn dung lượng tải khác nhau).

Chặn Googlebot trong robots.txt có ảnh hưởng đến Google Discover hay Google News không?

Có. Theo tài liệu chính thức, việc chặn Googlebot crawl một trang sẽ ảnh hưởng đến toàn bộ hệ sinh thái Google Tìm kiếm, bao gồm cả Discover và các tính năng tìm kiếm khác, không chỉ kết quả tìm kiếm văn bản thông thường.

Nguồn tham khảo