sitemap 的角色是發現提示:向搜尋引擎提供網站 URL、檔案和部分更新資訊,讓它們更有效率地找到內容。這適用於大型、更新頻繁,或內部連結不完整的網站;已經有良好內部連結的小網站,sitemap 帶來的邊際效益有限——Google 官方也說正確的內部連結通常已經足以幫助發現 URL。本文提供的是可以逐項核對的東西:sitemap 回答與不回答哪些問題、六個驗收 gate、lastmod 的正確用法,以及 AI crawler 部分該怎麼查。
把 sitemap 想成交給訪客的一份地址清單。清單交出去了,對方會不會照著跑、跑了幾個、每個地方待多久,都不在你手上。清單本身是一個邀請,不是行程表。
AI crawler 讀不讀 sitemap、怎麼處理 lastmod、會不會使用頁面,按產品官方文件或指定觀測確認。
sitemap 是發現提示,六個驗收 gate 仍需分別核對,不保證抓取、索引或引用。
sitemap 的角色是發現,不是保證
Google 的 sitemap overview 說明 sitemap 可以提供頁面、影片或其他檔案的資訊,協助 Google 更有效率地抓取網站。它不是 Google Search 的必要條件,sitemap 裡的 URL 抓取與索引狀態也要另外確認。同一個邊界也適用於 AI crawler:它下載了你的 sitemap,證明的是它拿到那份清單——清單上幾百個 URL 它請求了幾個,是另一份資料。
sitemap 主要回答「網站想提供哪些 URL 給發現」,不回答以下問題:
- crawler 是否被 robots、WAF、HTTP 或登入層允許;
- 頁面是否有 noindex、重複內容或錯誤 canonical;
- initial HTML 或渲染後 DOM 是否含有可用文字;
- Google 或其他產品是否真的把頁面編入索引;
- AI 回答是否在指定查詢中選用並顯示該頁。
若要查跨平台 user-agent 和 sitemap 行為,請搭配 robots.txt 管理 AI crawler;本篇把 sitemap 限定在 URL discovery 和檔案治理。
sitemap、robots、canonical 與內部連結
四個工具互補但責任不同:
| 工具 | 主要作用 | 需要保留的證據 | 結果界線 |
|---|---|---|---|
| sitemap | 提供 URL 發現與更新提示 | XML、index、提交時間 | 抓取與索引需另查 |
| robots.txt | 控制部分 crawler 可請求的路徑 | 規則版本、user-agent、解析 | 不負責 canonical 或從索引隱藏 |
| canonical | 提示重複 URL 的偏好版本 | HTML、header、redirect、selected value | Google 仍可能選不同 URL |
| internal link | 讓 crawler 沿站內路徑發現與理解頁面 | href、anchor、parent/sibling | AI 引用需另查 |
Google 的 canonical 文件 說 redirect 和 rel canonical 是較強訊號,sitemap 是較弱訊號,並建議內部連結指向 canonical URL。Google 的 robots 文件 則提醒 robots 不是完整的隱藏方法。把四個工具混成一個「AI visibility 設定」會讓每次驗收失去分母和責任範圍。
XML sitemap 應該整理什麼
每個 <url> 都要回到網站已決定的公開 URL。實務上至少檢查:
loc使用正確 protocol、host、path 和語言版本。- URL 可以在不需登入的情況下取得,或明確從提交範圍排除。
loc與頁面的 canonical、內部連結和 redirect 方向一致。- sitemap 不混入未公開草稿、404、5xx、需要登入或明確 noindex 的頁面。
lastmod只在有實質內容更新時更新,並能回到版本紀錄。- XML 編碼、大小、URL 數和 sitemap index 結構符合 Google 文件限制。
- 圖片、影片或新聞 sitemap 只在有實際檔案和相應用途時使用。
Google 的 建立與提交 sitemap 文件要求 lastmod 反映重大更新,並且日期可由內容或版本紀錄驗證。本文的稽核方法因此把 lastmod 視為更新提示,不把它當成要求 crawler 立即抓取或頁面新鮮度的獨立證據。如果 CMS 每次重新建置就改所有 lastmod,會降低欄位的可讀性;沒有版本紀錄支持的日期,應保留未知,不要補一個看似精準的時間。
大型網站的 sitemap index
如果 URL 數量、語言、內容類型或更新頻率讓單檔難以治理,可以使用 sitemap index 將多個 sitemap 分組。分組方式應能回溯內容負責人和來源,例如產品、文章、圖片、地區或語言,而不是只按產生日期切檔。每個子 sitemap 都要能獨立檢查 HTTP、XML、URL 狀態和 canonical。
對 AI 搜尋稽核來說,sitemap index 仍需查證某個產品是否掃描全部子檔。記錄提交或公開位置、讀取日期、response 狀態和實際包含的 URL 數。若只有 Search Console 的提交紀錄,這是提交證據,不是索引或 AI 引用證據。
從檔案到 AI observation 的驗收
可以用六個檢查建立一份小型確認紀錄:
| 檢查層 | 檢查 | 狀態值例子 |
|---|---|---|
| source | 生成內容與內容負責人的 URL 清單一致 | pass、needs-review |
| XML | sitemap 或 index 可解析,URL 格式正確 | pass、error |
| HTTP | sitemap、頁面與資產 response 可取得 | 200、redirect、4xx、5xx |
| policy | robots、WAF、noindex、canonical 互相一致 | aligned、conflict、未確認 |
| index | Google 或產品工具有第一手索引資料 | verified、未確認 |
| answer | 固定 query 中的 AI citation 觀測 | observed、not observed、無資料 |
驗收時先記錄日期、時區、property、URL 數和分組方法。observed 只描述指定產品、查詢和日期看見的答案;not observed 是樣本中沒有看見;無資料是資料不足。這些值不能被報告成全站平均或所有平台的 SOV。
若要驗證 Google AI features,Google 文件要求頁面可被抓取、索引並符合 snippet 資格;抓取、索引和顯示仍要按產品狀態確認。若要驗證其他 AI crawler,應另查官方 crawler 文件;不要以 sitemap 的 200 response 取代產品答案觀測。
常見錯誤與修正
只提交 sitemap,不做內部連結
修正:確認重要頁面從 parent、分類或 sibling 可達,並用描述性 anchor 指向 canonical URL。sitemap 是補充路徑,不是站內資訊架構的替代品。
Sitemap 列了大量不存在的 URL
修正:先清理 404、redirect chain、未公開草稿、noindex 和重複 URL,再決定提交範圍。無法回溯的 URL 數會讓讀者誤判 coverage。
用 lastmod 宣稱 AI crawler 已更新
修正:lastmod 是更新提示。若要說 crawler 已抓取,需有 server log、平台文件或其他第一手證據;若要說 AI 答案更新,需有固定 query 觀測。
Sitemap 中的 canonical 和頁面不一致
修正:建立 declared canonical、selected canonical 和 cited URL 的對照,先參考 可爬取頁面的基本檢查,不要只改 XML 而忽略頁面 HTML。
常見問題
Sitemap 能保證 AI crawler 發現頁面嗎?
sitemap 提供的是 URL 發現和更新提示,Google 官方也說抓取與索引要另查。其他 AI crawler 讀不讀 sitemap,按各自的官方文件或指定 request 觀測確認——「我提交了 sitemap」和「它們發現了這些頁面」之間,還缺一份 log。
robots.txt 阻擋後,sitemap 還有用嗎?
它仍然可能提供 URL 發現資訊——crawler 知道那個網址存在,但請求不到內容,就像拿到地址卻進不了大門。目標若是傳遞頁面指令,robots 阻擋會讓 crawler 連指令都看不到;存取控制和索引控制分開處理。
sitemap 中應該放 canonical URL 嗎?
讓 sitemap、頁面 canonical、redirect 和內部連結指向同一個偏好版本——四個訊號互相矛盾時,搜尋引擎會自己選一個,而那未必是你要的。sitemap 本身屬於較弱訊號,每個 URL 仍要檢查取不取得到、內容一不一致、符不符合索引目標。
lastmod 越新越容易被 AI 引用嗎?
lastmod 是更新提示,AI citation 是產品在查詢中選用來源的結果,兩者之間沒有換算關係。把每個 URL 的 lastmod 每天刷新一次,內容沒變——這個做法會讓那個欄位失去它原本的資訊價值。日期、內容品質、可抓取性和產品選用分開觀測。
Sitemap 已提交但工具沒有資料,代表失敗嗎?
先確認五件事:property、提交位置、讀取時間、XML response、URL 範圍。都查過仍然沒有足夠資料的話,記錄無資料或待確認——「工具上沒看到」和「沒有發生」是兩種狀態,寫成零的那一刻,後面的報表就開始失真了。
若要把 sitemap 檢查放回內容治理,可先查看 EthorX GEO 服務;產品觀測入口可參考 Otlex。這些連結不是 sitemap 提交或 AI citation 的外部成果證據。
查證邊界
本文依 Google sitemap、canonical、robots 與 AI features 文件整理 URL discovery、lastmod 和觀測分工;沒有取得特定網站的 sitemap submission 結果、伺服器 log、正式索引資料或 AI answer 樣本。sitemap 與更新日期只能作為待驗證訊號,不能推出 crawler 已抓取、頁面已索引或產品已引用。