Technical GEO là lớp kỹ thuật giúp website đủ điều kiện được crawler truy cập, render và lập chỉ mục đúng cách trong Search và các hệ thống AI có hỗ trợ web. Nó không thay thế SEO và không bảo đảm AI citation.
Nếu cần bức tranh tổng thể trước khi đi sâu vào crawler, robots.txt và WAF, xem chiến lược GEO cho SEO và AI Search. Nếu URL đã được tìm thấy nhưng không được chọn làm nguồn, xem framework Eligibility → Retrieval → Selection.

Technical GEO là gì và không phải là gì?
Technical GEO hữu ích khi cần trả lời bốn câu hỏi: nội dung nào được công khai, crawler nào được phép truy cập, lớp hạ tầng nào đang chặn nhầm bot hợp lệ và dữ liệu nào chứng minh việc truy cập thực sự xảy ra.
| Có thể làm | Không bảo đảm |
|---|---|
| Phát hiện robots, WAF, 403/429, redirect và rendering gap. | Được AI trích dẫn hoặc xếp hạng theo một tỷ lệ cố định. |
| Tách search, training và user-triggered access. | Một robots rule đúng cho mọi nền tảng. |
| Tạo evidence từ log, Search Console và referral. | Bot crawl nhiều = nội dung được đánh giá cao. |
| Giảm lỗi crawl/index trên URL quan trọng. | Technical fix thay thế content quality, relevance hoặc authority. |
Crawler: đừng gom mọi “AI bot” thành một nhóm
| Nền tảng / bot | Mục đích | Điểm quản trị |
|---|---|---|
| Googlebot | Crawl cho Google Search. | Kiểm robots, status, render, indexability và canonical. |
| OAI-SearchBot | Search features của ChatGPT. | Quản trị độc lập với GPTBot. |
| GPTBot | Crawler liên quan tới cải thiện/huấn luyện mô hình OpenAI. | Allow/Disallow theo data policy. |
| ChatGPT-User | User-triggered access. | Không đồng nhất với Search crawler. |
| Claude-SearchBot / ClaudeBot / Claude-User | Search, training và user-triggered access của Anthropic. | Quản trị theo mục đích và tài liệu hiện hành. |
| PerplexityBot / Perplexity-User | Search/index và user-triggered access. | Kiểm policy và IP ranges hiện hành. |
Crawler name, user-agent, IP range và policy có thể thay đổi. Trước khi sửa production, đối chiếu OpenAI Crawlers, Anthropic crawler guidance và Perplexity Crawlers.
Robots.txt là crawl policy, không phải security control
Robots.txt thể hiện preference truy cập nhưng không bảo vệ dữ liệu nhạy cảm và không phải cơ chế chắc chắn để loại URL khỏi index. Trang account, admin, tài liệu trả phí hoặc dữ liệu khách hàng cần authentication/authorization phù hợp. Nếu cần deindex, dùng chỉ thị phù hợp và bảo đảm crawler có thể đọc chỉ thị đó.
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Googlebot
Allow: /
User-agent: *
Disallow: /wp-admin/
Disallow: /checkout/
Sitemap: https://example.com/sitemap.xmlĐây chỉ là ví dụ minh họa việc tách Search và training trong hệ sinh thái OpenAI. Không copy vào production nếu chưa xác định mục tiêu, host/subdomain, dữ liệu nhạy cảm và crawler documentation hiện hành.
WAF, CDN và bot verification

User-agent có thể bị giả mạo. Khi nền tảng công bố IP ranges hoặc verification method, dùng chúng cùng user-agent, HTTP behavior và log thay vì allowlist chỉ bằng chuỗi tên.
| Finding | Evidence | Fix |
|---|---|---|
| 403/401 | WAF event, rule ID, URL, UA/IP. | Xác minh bot và sửa rule có phạm vi. |
| 429 | Rate-limit logs và cadence. | Điều chỉnh quota theo capacity. |
| UA đúng, IP không khớp | Published ranges/verification method. | Không mặc định là bot chính thức. |
| Challenge page | Response HTML hoặc WAF log. | Loại challenge cho bot đã xác minh nếu policy cho phép. |
Rendering: kiểm raw HTML và rendered output

Google có thể xử lý JavaScript nếu tài nguyên không bị chặn, nhưng JavaScript SEO phức tạp hơn static/server-rendered HTML. Với URL quan trọng, hãy so raw HTML, rendered HTML, canonical, internal links, structured data và response thực tế; không dùng quy tắc tuyệt đối kiểu “AI chỉ đọc HTML ban đầu”.
Structured data và llms.txt
Không có “AI schema”. Structured data phải khớp nội dung hiển thị và chỉ tạo eligibility cho các Search features được hỗ trợ; validation PASS không bảo đảm rich result. Với Google Search, llms.txt không phải requirement và không nên được coi là sitemap, robots directive hoặc ranking signal.
Server log đo access, không chứng minh citation
Log chứng minh request tới server, status và response; không chứng minh trang được index, dùng để training, được citation hay “được AI đánh giá cao”. Cần phân biệt UA/IP, status, URL, timestamp và response size, rồi kết hợp dữ liệu sản phẩm riêng của từng nền tảng.
Đo hiệu quả sau triển khai
| Lớp đo | Nguồn | Giới hạn |
|---|---|---|
| Access | Server/WAF logs, robots và HTTP response. | Access không bảo đảm index/citation. |
| Google Search | URL Inspection và Search Console Performance. | Không mô tả đầy đủ source-selection event. |
| AI referral | Analytics/referrer khi có. | Không đo mention/citation không tạo click. |
| Business outcome | Lead, booking, purchase, CRM. | Cần attribution và deduplication. |
Checklist Technical GEO theo decision gate
- Policy: search, training và user-triggered access có quyết định riêng.
- Robots: rule đúng host/subdomain và user-agent hiện hành.
- WAF/CDN: bot hợp lệ không bị 403/429/challenge ngoài chủ đích.
- Render: primary content, links, metadata và schema xuất hiện trong rendered output.
- Indexability: status, canonical, robots meta, sitemap và internal link nhất quán.
- Logs: có timestamp, URL, status, UA/IP và retention phù hợp.
- Measurement: Search Console, referral và business outcome có baseline.
Nguồn cần đối chiếu
- Google Search Central — AI features and your website
- Google — Optimizing for generative AI features
- OpenAI Crawlers
- Anthropic crawler guidance
- Perplexity Crawlers
Kết luận
Technical GEO thực chất là crawler governance + Technical SEO + security controls + measurement có evidence. Khi technical eligibility đã ổn nhưng URL vẫn không được chọn làm nguồn, vấn đề chuyển sang retrieval, passage clarity, evidence và source selection — lúc đó nên dùng framework AI Reranking thay vì tiếp tục sửa robots hoặc WAF.
Đoàn Trình Dục là Giảng viên Khoa Công nghệ Thông tin tại Đại học Công nghệ Sài Gòn (STU), với hơn 10 năm kinh nghiệm thực chiến trong các lĩnh vực Mạng máy tính, Marketing Online, SEO và Bảo mật hệ thống.
Với nền tảng sư phạm và kinh nghiệm tư vấn cho nhiều doanh nghiệp, thầy chuyên sâu vào việc xây dựng các giải pháp kỹ thuật số toàn diện và hiệu quả.

