Bỏ qua đến nội dung
Hotline: 0346 844 259 0908 415 302 info@w3seo.com 46/1/56 Vườn Chuối, Phường 04, Quận 03, Thành phố Hồ Chí Minh
Trang chủSEOTechnical SEO & hiệu năngWeb Crawler là gì? Cách bot crawl, render và kiểm…

Web Crawler là gì? Cách bot crawl, render và kiểm tra website

Web Crawler là bot tự động khám phá và tải URL; bài phân biệt discovery, crawl, render, index và ranking, đồng thời hướng dẫn robots.txt, sitemap, log và xác minh Googlebot theo tài liệu hiện hành.

Web crawler là phần mềm tự động request URL, nhận phản hồi và khám phá thêm tài nguyên hoặc liên kết. Với Google Search, Googlebot tìm URL, crawl nội dung và có thể chuyển trang sang bước render trước khi hệ thống xem xét indexing. Crawl không đồng nghĩa với index, và index không đồng nghĩa với ranking.

Crawler, render, index và ranking khác nhau thế nào?

Giai đoạn Câu hỏi cần trả lời Bằng chứng nên kiểm tra
Discovery Google có biết URL tồn tại? Internal link, sitemap, URL inventory
Crawl Googlebot có request được URL? Server/CDN log, Crawl Stats, HTTP response
Render Nội dung và link quan trọng có xuất hiện sau JavaScript? URL Inspection, raw/rendered HTML
Index URL có được chọn để lưu trong index? URL Inspection, canonical, robots directives
Ranking Trang có phù hợp với truy vấn cụ thể? Search Console và kết quả tìm kiếm

Một HTTP 200 chỉ chứng minh server trả phản hồi thành công; nó không chứng minh nội dung đã render đúng, canonical đúng hoặc URL đã được index.

Googlebot là gì?

Googlebot là crawler của Google Search. Google công bố Googlebot Smartphone và Googlebot Desktop; phần lớn website được xử lý theo phiên bản mobile. Không nên xác thực Googlebot chỉ bằng User-Agent vì chuỗi này có thể bị giả mạo. Khi phân tích log hoặc cấu hình WAF, hãy dùng hướng dẫn xác minh Googlebot của Google.

Các loại crawler không nên bị gom làm một

Đây là phần cần giữ vì cách xử lý phụ thuộc mục đích của bot. Search crawler, SEO crawler, archive crawler, product-specific crawler và bot tự xưng Googlebot không có cùng vai trò hay mức độ tin cậy.

Nhóm Mục đích Cách xử lý
Search crawler Khám phá nội dung cho công cụ tìm kiếm Kiểm tra robots, status, render và xác thực khi cần
SEO crawler Mô phỏng link graph và lỗi kỹ thuật Giới hạn tốc độ; không dùng làm bằng chứng Google đã crawl
Archive/research crawler Lưu trữ hoặc nghiên cứu Đánh giá robots policy, privacy và server cost
Product/fetcher Tải URL cho một sản phẩm hoặc hành động cụ thể Đọc tài liệu của nhà cung cấp thay vì suy từ Googlebot
Bot đáng ngờ Scrape, scan hoặc abuse Xác thực IP, dùng WAF/rate limit/auth phù hợp

Robots.txt chỉ là chỉ dẫn cho crawler tuân thủ chuẩn, không phải hàng rào bảo mật. Dữ liệu riêng tư phải được bảo vệ ở server.

Web crawler hoạt động như thế nào?

Quy trình thực tế có thể tóm gọn thành: phát hiện URL → xếp lịch → kiểm tra quyền truy cập → fetch → xử lý HTML → render khi cần → xem xét indexing → recrawl. Website không kiểm soát lịch crawl của Google, nhưng có thể giảm ma sát bằng cấu trúc URL rõ, internal link crawlable, server ổn định và dữ liệu nhất quán.

Vấn đề Tác động Việc nên làm
Orphan URL Khó discovery Thêm internal link từ hub/category phù hợp
Robots.txt chặn nhầm Bot không fetch được nội dung Kiểm tra rule theo URL mẫu
5xx/timeout Crawl thất bại Kiểm tra server, CDN, WAF và log
Link chỉ sinh sau interaction Discovery kém ổn định Dùng liên kết HTML <a href> cho đường dẫn quan trọng
Facet/parameter vô hạn Lãng phí crawl vào URL ít giá trị Quản trị URL space và internal link
Sitemap chứa redirect/noindex/404 Tín hiệu URL không nhất quán Chỉ giữ preferred canonical indexable 200 URL

JavaScript tạo thêm điểm thất bại ở đâu?

Trang JavaScript-heavy có thể fetch thành công nhưng vẫn thiếu nội dung quan trọng khi render. Khi audit, đừng chỉ nhìn screenshot. So sánh raw HTML với rendered HTML và kiểm tra xem title, canonical, robots, nội dung chính và internal link có phụ thuộc API, interaction, cookie, authentication hoặc script bên thứ ba hay không.

  • Nội dung chính chỉ xuất hiện sau click/scroll phức tạp.
  • API lỗi hoặc cần token khiến bot nhận DOM rỗng.
  • Canonical hoặc robots directive thay đổi sau render.
  • Navigation được gắn bằng event nhưng không có href crawlable.
  • CSS/JS thiết yếu bị chặn hoặc trả lỗi.

Google mô tả crawling, rendering và indexing là các pha liên quan nhưng tách biệt. Vì vậy “Googlebot đã request URL” chưa đủ để kết luận trang đã được xử lý hoàn chỉnh.

Cách kiểm tra crawler có truy cập website không

Không có một công cụ duy nhất trả lời mọi câu hỏi. Hãy đối chiếu nhiều lớp bằng chứng:

  1. URL Inspection: xem indexed state, lần crawl gần nhất, canonical và live test.
  2. Server/CDN log: xác nhận request thật, thời điểm, status và latency.
  3. Crawl Stats: xem xu hướng request Googlebot, response code và host availability.
  4. SEO crawler: mô phỏng link graph, status, canonical và directives; không dùng nó làm bằng chứng rằng Googlebot đã crawl.
  5. Raw vs rendered HTML: kiểm tra nội dung, canonical và internal link có phụ thuộc JavaScript hay không.

Cách đọc bằng chứng để tránh kết luận sai

Nguồn Cho biết tốt nhất Không chứng minh
URL Inspection index view Google đang ghi nhận trạng thái index/canonical thế nào Trạng thái live ở giây hiện tại
Live URL Test Google có thể fetch/render URL lúc test URL chắc chắn sẽ được index
Server log Request nào đã đến server và nhận status gì User-Agent tự xưng Googlebot là hợp lệ
Crawl Stats Xu hướng crawl theo host/status/file type Nguyên nhân của từng URL cụ thể
SEO crawler Link graph, status, directives theo cấu hình crawl Google đã nhìn thấy hoặc index URL

Robots.txt, sitemap và noindex dùng khác nhau

Công cụ Mục đích Sai lầm phổ biến
robots.txt Quản lý crawler access Dùng như cơ chế noindex hoặc bảo mật
Sitemap XML Khai báo URL preferred cần được khám phá Đưa URL redirect, noindex, 404 hoặc canonical sang nơi khác
meta robots noindex Yêu cầu không index trang Chặn robots.txt khiến crawler không đọc được noindex

Robots.txt không phải cơ chế bảo mật. Nội dung riêng tư cần authentication và authorization ở phía server.

Crawl budget có phải vấn đề với mọi website?

Không. Website nhỏ và vừa thường nên ưu tiên lỗi discovery, URL trùng lặp, server availability, internal link và chất lượng URL trước khi tối ưu “crawl budget”. Google dành hướng dẫn crawl budget chuyên sâu chủ yếu cho site rất lớn hoặc thay đổi nhanh. Xem tài liệu crawl budget.

Tình huống chẩn đoán nhanh

Giả sử một cụm bài viết quan trọng được cập nhật nhưng Google ít quay lại. Đừng request indexing hàng loạt ngay. Hãy kiểm tra theo chuỗi: URL có internal link không → sitemap có chứa URL preferred không → log có request Googlebot không → response có ổn định không → raw/rendered HTML có nội dung/link quan trọng không → canonical/noindex có mâu thuẫn không. Nếu discovery và fetch đều ổn nhưng URL vẫn không index, lúc đó vấn đề đã chuyển sang lớp indexing/chất lượng chứ không còn là “crawler không vào”.

Checklist audit crawl

  • URL quan trọng trả đúng HTTP status, không có redirect chain và không tạo broken link trong các đường dẫn quan trọng.
  • Internal link quan trọng là link HTML crawlable.
  • Sitemap chỉ chứa URL canonical, indexable, trả 200.
  • Robots.txt không chặn nhầm nội dung hoặc tài nguyên cần thiết.
  • Nội dung chính và link quan trọng có trong HTML hoặc render ổn định.
  • Facet, filter, parameter và search URL không tạo không gian URL vô hạn.
  • Server log không cho thấy 5xx, timeout hoặc WAF chặn Googlebot hợp lệ.
  • Canonical, noindex và redirect không mâu thuẫn với mục tiêu của URL.

FAQ

Crawler có quyết định thứ hạng không?

Không. Crawl là bước thu thập dữ liệu. Ranking xảy ra ở giai đoạn khác và phụ thuộc truy vấn cùng nhiều hệ thống đánh giá khác.

Chặn robots.txt có làm URL biến mất khỏi Google không?

Không nên dùng robots.txt để noindex. URL bị chặn crawl vẫn có thể được biết đến từ liên kết khác. Nếu mục tiêu là không index, dùng cơ chế phù hợp như noindex khi crawler vẫn truy cập được trang.

Sitemap có bảo đảm URL được crawl hoặc index không?

Không. Sitemap là tín hiệu discovery, không phải bảo đảm indexing.

Kết luận

Audit crawler hiệu quả cần tách rõ discovery, crawl, render, index và ranking. Với phần lớn website, hãy ưu tiên internal link rõ, sitemap sạch, status code đúng, server ổn định, JavaScript có thể render và quản trị URL space. Nếu URL chưa index, đừng mặc định lỗi nằm ở crawler; hãy xác định chính xác giai đoạn nào đang thất bại trước khi sửa.