Bỏ qua đến nội dung
Hotline: 0902 711 308 info@w3seo.com 46/1/56 Vườn Chuối, Phường 04, Quận 03, Thành phố Hồ Chí Minh
Trang chủSEOGEOTechnical GEO: Crawler access, robots.txt, WAF và rendering

Technical GEO: Crawler access, robots.txt, WAF và rendering

Technical GEO theo hướng evidence: tách search/training/user-triggered bots, kiểm robots, WAF, render và logs; cập nhật Google AI Search, llms.txt, FAQ rich results và Search Console ngày 07/09/2026.

Technical GEO là lớp kỹ thuật giúp website đủ điều kiện được crawler truy cập, render và lập chỉ mục đúng cách trong Search và các hệ thống AI có hỗ trợ web. Nó không thay thế SEO và không bảo đảm AI citation.

Nếu cần bức tranh tổng thể trước khi đi sâu vào crawler, robots.txt và WAF, xem chiến lược GEO cho SEO và AI Search. Nếu URL đã được tìm thấy nhưng không được chọn làm nguồn, xem framework Eligibility → Retrieval → Selection.

Bản đồ crawler search training và user-triggered agent trong Technical GEO
Search crawler, training crawler và user-triggered agent cần được quản trị riêng theo tài liệu của từng nền tảng.

Technical GEO là gì và không phải là gì?

Technical GEO hữu ích khi cần trả lời bốn câu hỏi: nội dung nào được công khai, crawler nào được phép truy cập, lớp hạ tầng nào đang chặn nhầm bot hợp lệ và dữ liệu nào chứng minh việc truy cập thực sự xảy ra.

Có thể làmKhông bảo đảm
Phát hiện robots, WAF, 403/429, redirect và rendering gap.Được AI trích dẫn hoặc xếp hạng theo một tỷ lệ cố định.
Tách search, training và user-triggered access.Một robots rule đúng cho mọi nền tảng.
Tạo evidence từ log, Search Console và referral.Bot crawl nhiều = nội dung được đánh giá cao.
Giảm lỗi crawl/index trên URL quan trọng.Technical fix thay thế content quality, relevance hoặc authority.

Crawler: đừng gom mọi “AI bot” thành một nhóm

Nền tảng / botMục đíchĐiểm quản trị
GooglebotCrawl cho Google Search.Kiểm robots, status, render, indexability và canonical.
OAI-SearchBotSearch features của ChatGPT.Quản trị độc lập với GPTBot.
GPTBotCrawler liên quan tới cải thiện/huấn luyện mô hình OpenAI.Allow/Disallow theo data policy.
ChatGPT-UserUser-triggered access.Không đồng nhất với Search crawler.
Claude-SearchBot / ClaudeBot / Claude-UserSearch, training và user-triggered access của Anthropic.Quản trị theo mục đích và tài liệu hiện hành.
PerplexityBot / Perplexity-UserSearch/index và user-triggered access.Kiểm policy và IP ranges hiện hành.

Crawler name, user-agent, IP range và policy có thể thay đổi. Trước khi sửa production, đối chiếu OpenAI Crawlers, Anthropic crawler guidance và Perplexity Crawlers.

Robots.txt là crawl policy, không phải security control

Robots.txt thể hiện preference truy cập nhưng không bảo vệ dữ liệu nhạy cảm và không phải cơ chế chắc chắn để loại URL khỏi index. Trang account, admin, tài liệu trả phí hoặc dữ liệu khách hàng cần authentication/authorization phù hợp. Nếu cần deindex, dùng chỉ thị phù hợp và bảo đảm crawler có thể đọc chỉ thị đó.

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Googlebot
Allow: /

User-agent: *
Disallow: /wp-admin/
Disallow: /checkout/

Sitemap: https://example.com/sitemap.xml

Đây chỉ là ví dụ minh họa việc tách Search và training trong hệ sinh thái OpenAI. Không copy vào production nếu chưa xác định mục tiêu, host/subdomain, dữ liệu nhạy cảm và crawler documentation hiện hành.

WAF, CDN và bot verification

Robots WAF CDN và server log trong crawler governance
Robots thể hiện preference; WAF/CDN/server quyết định request có thực sự tới ứng dụng hay không.

User-agent có thể bị giả mạo. Khi nền tảng công bố IP ranges hoặc verification method, dùng chúng cùng user-agent, HTTP behavior và log thay vì allowlist chỉ bằng chuỗi tên.

FindingEvidenceFix
403/401WAF event, rule ID, URL, UA/IP.Xác minh bot và sửa rule có phạm vi.
429Rate-limit logs và cadence.Điều chỉnh quota theo capacity.
UA đúng, IP không khớpPublished ranges/verification method.Không mặc định là bot chính thức.
Challenge pageResponse HTML hoặc WAF log.Loại challenge cho bot đã xác minh nếu policy cho phép.

Rendering: kiểm raw HTML và rendered output

So sánh raw HTML rendered HTML SSR SSG và client-side rendering
Stable rendered output giúp QA và giảm dependency trên URL quan trọng.

Google có thể xử lý JavaScript nếu tài nguyên không bị chặn, nhưng JavaScript SEO phức tạp hơn static/server-rendered HTML. Với URL quan trọng, hãy so raw HTML, rendered HTML, canonical, internal links, structured data và response thực tế; không dùng quy tắc tuyệt đối kiểu “AI chỉ đọc HTML ban đầu”.

Structured data và llms.txt

Không có “AI schema”. Structured data phải khớp nội dung hiển thị và chỉ tạo eligibility cho các Search features được hỗ trợ; validation PASS không bảo đảm rich result. Với Google Search, llms.txt không phải requirement và không nên được coi là sitemap, robots directive hoặc ranking signal.

Server log đo access, không chứng minh citation

Log chứng minh request tới server, status và response; không chứng minh trang được index, dùng để training, được citation hay “được AI đánh giá cao”. Cần phân biệt UA/IP, status, URL, timestamp và response size, rồi kết hợp dữ liệu sản phẩm riêng của từng nền tảng.

Đo hiệu quả sau triển khai

Lớp đoNguồnGiới hạn
AccessServer/WAF logs, robots và HTTP response.Access không bảo đảm index/citation.
Google SearchURL Inspection và Search Console Performance.Không mô tả đầy đủ source-selection event.
AI referralAnalytics/referrer khi có.Không đo mention/citation không tạo click.
Business outcomeLead, booking, purchase, CRM.Cần attribution và deduplication.

Checklist Technical GEO theo decision gate

  • Policy: search, training và user-triggered access có quyết định riêng.
  • Robots: rule đúng host/subdomain và user-agent hiện hành.
  • WAF/CDN: bot hợp lệ không bị 403/429/challenge ngoài chủ đích.
  • Render: primary content, links, metadata và schema xuất hiện trong rendered output.
  • Indexability: status, canonical, robots meta, sitemap và internal link nhất quán.
  • Logs: có timestamp, URL, status, UA/IP và retention phù hợp.
  • Measurement: Search Console, referral và business outcome có baseline.

Nguồn cần đối chiếu

Kết luận

Technical GEO thực chất là crawler governance + Technical SEO + security controls + measurement có evidence. Khi technical eligibility đã ổn nhưng URL vẫn không được chọn làm nguồn, vấn đề chuyển sang retrieval, passage clarity, evidence và source selection — lúc đó nên dùng framework AI Reranking thay vì tiếp tục sửa robots hoặc WAF.