AI crawler 可存取檢查表:從 robots 到 HTML 的 8 層稽核
AI crawler 能否取得可用內容,取決於 robots、HTTP、WAF、HTML、渲染、canonical 與索引指令的組合。本文提供不把可存取誤寫成 AI 引用的逐層檢查表。
robots.txt、AI crawler、JavaScript 渲染、sitemap、canonical、schema 與 llms.txt 的實作方式與驗收界線。
10 篇文章
顯示 10 篇文章
AI crawler 能否取得可用內容,取決於 robots、HTTP、WAF、HTML、渲染、canonical 與索引指令的組合。本文提供不把可存取誤寫成 AI 引用的逐層檢查表。
Article schema 可以提供文章標題、圖片、日期與作者等結構化線索,但不是 AI Search 的特殊排名開關。本文整理 Google 官方要求、JSON-LD 範例與可見內容對照方法。
canonical 是搜尋引擎處理重複 URL 的重要訊號,但不是控制 AI citation 的命令。本文整理 rel canonical、redirect、sitemap、內部連結與實際引用 URL 的判讀方法。
Google 已於 2026 年 5 月 7 日停止在搜尋結果顯示 FAQ rich results。本文整理 FAQ schema、可見問答、AI Search、Article schema 與目前可驗證的限制。
JavaScript 內容能否被 AI Search 使用,不能只看瀏覽器畫面。本文依 Google 的抓取、渲染、索引流程,整理初始 HTML、HTTP 狀態、SSR、hydration 與 crawler 差異。
llms.txt 是網站提供給語言模型的內容導覽提案,不是 robots.txt 或 sitemap 的替代品。本文整理格式、維護條件、驗收步驟與 Google 官方目前的限制。
Google 的 nosnippet、max-snippet 與 data-nosnippet 有不同用途。本文整理它們對搜尋摘要與 AI Overviews、AI Mode 的適用範圍、設定方式與限制。
OAI-SearchBot、GPTBot 與 ChatGPT-User 不是同一種存取情境。本文用 OpenAI 官方文件整理 robots.txt 政策、設定範例與驗收步驟。
不同 AI crawler 的用途、user-agent 與 robots.txt 行為各自不同。本文用跨平台矩陣整理 Google、OpenAI、Anthropic、Perplexity、Apple 與 Common Crawl 的政策邊界。
sitemap 能提供 URL 與更新資訊,協助搜尋引擎發現網站內容,但不保證 AI crawler 抓取、索引或引用。本文整理 sitemap、robots、canonical、內部連結與驗收步驟。
專欄內容
我們將陸續分享 AI 產業觀察、工作應用與網站實務,敬請期待。