Bỏ qua đến nội dung
Hotline: 0346 844 259 info@w3seo.com 46/1/56 Vườn Chuối, Phường 04, Quận 03, Thành phố Hồ Chí Minh
WH JOURNAL06.2026GEO

Technical GEO: Crawler access, robots.txt, WAF và rendering

Thời lượng10 phútCập nhật 17/07/2026
technical-geo-ai-crawler-readiness

Technical GEO là cách gọi trong ngành cho việc quản trị quyền truy cập, khả năng render, dữ liệu kỹ thuật và đo lường khi website có thể được Google Search hoặc các dịch vụ AI truy xuất. Đây không phải một lớp kỹ thuật tách khỏi SEO và không bảo đảm website sẽ được AI trích dẫn.

Công việc đúng là phân biệt search crawler, training crawler và user-triggered agent; kiểm tra robots.txt, WAF, status, rendering, structured data và server log theo tài liệu của từng nền tảng. Với Google AI Overviews và AI Mode, không có yêu cầu kỹ thuật bổ sung ngoài nền tảng Google Search.

Bản đồ crawler search training và user-triggered agent trong Technical GEO
Không gom mọi AI bot thành một nhóm: mục đích, robots policy và cách xác minh của từng user-agent khác nhau.

Technical GEO là gì và không phải là gì?

Technical GEO là khung quản trị nội bộ giúp doanh nghiệp quyết định nội dung nào được công khai, crawler nào được phép truy cập, bot nào chỉ phục vụ training và dữ liệu nào cần bảo vệ bằng xác thực. Nó sử dụng các công cụ quen thuộc của Technical SEO và security operations.

Technical GEO có thể làmTechnical GEO không bảo đảm
Giúp bot phù hợp truy cập URL công khai theo chính sách doanh nghiệp.Website được chọn làm citation hoặc được mô tả chính xác trong mọi câu trả lời.
Phát hiện 403, 429, redirect, robots conflict và rendering gap.Tăng ranking hoặc AI visibility theo một tỷ lệ cố định.
Phân biệt search, training và user-requested access.Một robots rule áp dụng giống nhau cho mọi nền tảng.
Tạo evidence từ log, Search Console và referral.Bot crawl nhiều đồng nghĩa nền tảng đánh giá website cao.

Google cho biết AI features vẫn dùng Search nền tảng; trang cần được index và đủ điều kiện hiển thị snippet, nhưng không có technical requirement đặc biệt, “AI schema” hoặc file máy đọc riêng. Xem AI features and your website.

Phân biệt search bot, training bot và user-triggered agent

Nền tảng/user-agentMục đích được công bốQuyết định quản trị
GooglebotCrawl cho Google Search, là nền tảng eligibility của AI Overviews và AI Mode.Cho phép các URL cần Search; kiểm tra robots, render và indexability.
OAI-SearchBotSurface website trong ChatGPT Search.Cho phép nếu muốn có cơ hội xuất hiện trong kết quả Search của ChatGPT.
GPTBotCrawl nội dung có thể được dùng cho training mô hình nền tảng OpenAI.Allow/Disallow theo chính sách dữ liệu; độc lập với OAI-SearchBot.
ChatGPT-UserTruy cập do người dùng hoặc Custom GPT kích hoạt; không dùng để xác định Search inclusion.Robots có thể không áp dụng như automatic crawler; kiểm soát bằng access policy và WAF.
Claude-SearchBotCrawl để cải thiện chất lượng search của Claude.Cho phép nếu mục tiêu là search visibility; kiểm tra tài liệu hiện hành trước triển khai.
ClaudeBotThu thập web content có thể đóng góp cho training.Allow/Disallow theo policy.
Claude-UserTruy xuất web theo yêu cầu người dùng Claude.Kiểm soát riêng với search crawler và training crawler.
PerplexityBotSurface và link website trong kết quả Perplexity; không dùng cho foundation-model training.Cho phép robots và IP ranges chính thức nếu muốn xuất hiện.
Perplexity-UserHỗ trợ user actions; không phải web crawler hoặc training bot.Quản trị như user-triggered access, không như index crawler.

Danh sách user-agent, mô tả và IP range có thể thay đổi. Trước mỗi lần sửa robots hoặc WAF, đối chiếu OpenAI Crawlers, Anthropic bot guidancePerplexity Crawlers.

Xây chính sách truy cập trước khi viết robots.txt

Không sao chép một mẫu robots.txt chung cho mọi website. Trước tiên, doanh nghiệp cần xác định mục tiêu theo loại nội dung và loại bot.

Loại nội dungSearch crawlerTraining crawlerUser-triggered access
Trang marketing công khaiThường cho phép.Theo policy doanh nghiệp.Thường cho phép nếu không có rủi ro.
Tài liệu trả phíChỉ phần preview công khai khi phù hợp.Thường hạn chế.Yêu cầu xác thực.
Dữ liệu khách hàng/nội bộKhông công khai.Không công khai.Không công khai; dùng authentication/authorization.
Checkout, tài khoản, adminKhông cần crawl.Không cần crawl.Chỉ người dùng hợp lệ truy cập.

Robots.txt quản lý crawl traffic, không phải cơ chế bảo mật hoặc cách chắc chắn loại URL khỏi index. Nội dung nhạy cảm cần password, authentication hoặc access control; URL cần deindex phải dùng cơ chế phù hợp và vẫn cho crawler đọc chỉ thị khi cần.

Ví dụ robots.txt có giới hạn phạm vi

Ví dụ sau chỉ minh họa cách tách Search và training trong hệ sinh thái OpenAI. Không copy vào production nếu chưa kiểm tra mục tiêu, host và crawler documentation hiện hành.

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Googlebot
Allow: /

User-agent: *
Disallow: /wp-admin/
Disallow: /checkout/

Sitemap: https://example.com/sitemap.xml

Robots.txt có phạm vi theo protocol/host/port. Website dùng nhiều subdomain như www, app, docs hoặc blog phải kiểm tra từng host. Sau thay đổi, lưu bản cũ, ngày deploy và acceptance criteria để rollback.

WAF, CDN và xác minh crawler

Robots WAF CDN và server log trong crawler governance
Robots cho biết preference; WAF và server mới thực thi access và bảo vệ hạ tầng.

User-agent có thể bị giả mạo. Khi nền tảng công bố IP ranges, dùng chúng cùng user-agent và behavior thay vì allowlist chỉ bằng chuỗi tên. OpenAI và Perplexity hiện công bố IP ranges cho một số crawler; chính sách của nền tảng khác có thể không giống nhau.

Kiểm traEvidenceHành động
403/401 tăngWAF event, rule ID, URL và user-agent.Sửa rule hoặc xác thực bot trước khi allow.
429 tăngRate-limit logs và request cadence.Điều chỉnh quota theo capacity, không bỏ rate limit toàn bộ.
UA khớp nhưng IP không khớpPublished ranges hoặc verification method.Không mặc định là bot chính thức.
Bot truy cập endpoint nhạy cảmPath, method và response.Chặn bằng access control/WAF; không dựa riêng robots.
Challenge page xuất hiệnHTML response hoặc screenshot từ request.Loại challenge cho bot đã xác minh nếu policy cho phép.

Rendering: raw HTML, rendered HTML và khả năng truy xuất

So sánh raw HTML rendered HTML SSR SSG và client-side rendering
Server-rendered content tăng tính nhất quán giữa crawler, nhưng Google có thể render JavaScript; cần kiểm tra output thực thay vì áp dụng quy tắc tuyệt đối.

Googlebot render JavaScript và có thể xử lý nội dung hoặc structured data được tạo trong DOM. Tuy nhiên, khả năng render, timeout và user-triggered access của mỗi dịch vụ khác nhau. Với URL quan trọng, SSR, SSG hoặc HTML có primary content thường giảm dependency và dễ QA hơn.

Evidence cần so sánhĐạt khiRủi ro
Raw HTMLCó title, canonical, primary content hoặc shell hợp lệ.HTML rỗng và phụ thuộc nhiều API.
Rendered HTMLNội dung, link và structured data xuất hiện đúng.Lỗi hydration, blocked resource hoặc delayed content.
No-JS/accessibilityNhiệm vụ chính vẫn hiểu và sử dụng được khi phù hợp.Button/tab không có semantic HTML hoặc keyboard access.
Server responseStatus và content nhất quán giữa user và bot hợp lệ.Cloaking hoặc error theo user-agent.

Accordion và tab không tự động là lỗi. Vấn đề là nội dung không tồn tại trong DOM/rendered output, không thể truy cập hoặc bị che giấu nhằm thao túng. Test URL mẫu bằng rendered HTML và thiết bị thật.

Structured data: dùng cho Search feature được hỗ trợ

Không có “AI schema” hoặc schema Technical GEO đặc biệt. Structured data có thể giúp Google hiểu nội dung và tạo eligibility cho một số Search features, nhưng phải khớp nội dung hiển thị và không bảo đảm rich result hoặc AI citation.

Thực hànhNhận định
Dùng Article, Breadcrumb, Organization, LocalBusiness hoặc Product khi đúng loại trang và tài liệu Google.Kiểm tra Search Gallery và guideline hiện hành trước triển khai.
Structured data tạo bằng JavaScript.Google có thể xử lý dữ liệu trong DOM sau render; vẫn cần Rich Results Test và URL Inspection.
Service schema.org.Có thể mô tả dữ liệu theo schema.org nhưng không phải rich-result type được Google bảo đảm.
FAQPage.Google đã ngừng FAQ rich results trong Search từ tháng 5/2026; không dùng chỉ để lấy diện tích SERP.
Schema không hiển thị hoặc claim sai.Không nên triển khai; markup phải phản ánh trang.

Đọc Schema là gì và tài liệu generate structured data with JavaScript.

llms.txt có phải yêu cầu Technical GEO không?

Không. Google Search nói rõ không dùng llms.txt; file này không giúp hoặc làm hại visibility/ranking trong Google. Chỉ duy trì nếu một hệ thống cụ thể mà doanh nghiệp sử dụng có tài liệu hỗ trợ và có owner cập nhật. Không coi nó là sitemap, robots directive hoặc yếu tố xếp hạng.

Thay vì đầu tư vào file không có consumer xác định, ưu tiên URL crawlable, sitemap sạch, canonical đúng, internal links, nội dung hữu ích và dữ liệu doanh nghiệp nhất quán.

Server log: đo crawl, không suy ra citation

Log cho biết request nào tới server, không cho biết mô hình “quan tâm”, đã index, đã dùng để training hoặc đã trích dẫn. Cần xác minh user-agent/IP và kết hợp với dữ liệu sản phẩm riêng của từng nền tảng.

OAI-SearchBot
GPTBot
ChatGPT-User
Claude-SearchBot
ClaudeBot
Claude-User
PerplexityBot
Perplexity-User
Log fieldDùng để xác nhậnKhông chứng minh
Timestamp, URL, methodRequest nào xảy ra và ở endpoint nào.Trang được đánh giá cao.
Status code200, redirect, 403, 429 hoặc 5xx.Nội dung đã được dùng trong câu trả lời.
User-agent và IPĐối chiếu bot công bố khi có.Danh tính tuyệt đối nếu chỉ nhìn user-agent.
Response time/bytesKhả năng phục vụ và lỗi response.“Crawl budget AI” hoặc conversion.
Referrer/UTM trong analyticsVisit đến từ ChatGPT hoặc nguồn khác khi có.Lượt mention không tạo click.

Checklist Technical GEO theo decision gate

Checklist Technical GEO theo crawler policy access rendering và measurement
Checklist là cổng QA vận hành; không phải danh sách yếu tố xếp hạng AI.
NhómAcceptance criteriaHard gate
PolicySearch, training và user-triggered access có quyết định riêng.Không biết ai phê duyệt hoặc nội dung nào được công khai.
RobotsRule theo đúng host và user-agent hiện hành.Chặn nhầm crawler phục vụ mục tiêu hoặc dùng robots như bảo mật.
WAF/CDNBot xác minh được không bị challenge ngoài chủ đích.403/429 hàng loạt hoặc allowlist chỉ theo UA.
RenderingPrimary content, links và metadata có trong rendered output.Trang quan trọng trả shell rỗng hoặc lỗi JS.
Index/URLStatus, canonical, robots meta và sitemap nhất quán.Owner bị noindex/canonical sai/redirect chain.
Structured dataLoại được hỗ trợ, khớp visible content và validate.Markup sai hoặc claim không hiển thị.
LogsCó timestamp, URL, status, UA/IP và retention phù hợp.Không thể phân biệt traffic thật với spoofed crawler.
MeasurementSearch Console, referral và business outcome có baseline.Dùng crawl count làm KPI citation.

Đo hiệu quả sau triển khai

Lớp đoNguồnGiới hạn
AccessServer/WAF logs, robots test và HTTP response.Access không bảo đảm index hoặc citation.
Google SearchURL Inspection, Performance và Generative AI report khi property được cấp.Báo cáo AI đang rollout và không đo nền tảng khác.
ReferralAnalytics, gồm utm_source=chatgpt.com khi có.Không đo mention không tạo click.
BusinessQualified lead, booking, purchase hoặc assisted conversion.Phụ thuộc attribution và deduplication.
Prompt observationBộ prompt có ngày, model, account và location.Không phải market share nếu sampling không đại diện.

Không đặt lịch tuần/tháng bắt buộc cho mọi website. Review ngay sau thay đổi robots, WAF, hosting, rendering, migration hoặc crawler policy; ngoài ra chọn cadence theo rủi ro và quy mô.

FAQ về Technical GEO

GPTBot có giúp xuất hiện trong ChatGPT Search không?

Không phải bot để quản lý Search inclusion. OAI-SearchBot phục vụ ChatGPT Search; GPTBot phục vụ crawl có thể dùng cho training.

Có nên chặn toàn bộ AI bot không?

Tùy policy. Hãy tách search, training và user-triggered agents; không dùng một quyết định chung cho mọi mục tiêu.

Nội dung có bắt buộc nằm trong HTML ban đầu không?

Không phải quy tắc tuyệt đối. Google có thể render JavaScript, nhưng server-rendered hoặc stable rendered output thường dễ kiểm tra và nhất quán hơn giữa các crawler.

Schema tạo bằng JavaScript có hợp lệ không?

Google có thể xử lý structured data trong DOM sau render. Cần test URL bằng Rich Results Test hoặc kiểm tra rendered HTML cho loại không được công cụ hỗ trợ.

llms.txt có bắt buộc không?

Không. Google Search không dùng file này và nó không ảnh hưởng tích cực hoặc tiêu cực đến visibility/ranking của Google.

Kết luận

Technical GEO đáng tin cậy là crawler governance và Technical SEO có kiểm soát: quyết định policy, xác minh user-agent/IP, giữ URL crawlable, render ổn định, markup đúng và log đủ để chẩn đoán. Không dùng bot crawl, llms.txt, schema hoặc server-side rendering như lời hứa citation.

Trước khi sửa production, kiểm tra tài liệu chính thức của từng nền tảng vì crawler names, IP ranges và chính sách có thể thay đổi. Lưu baseline, validate URL mẫu và có rollback plan.