網站實作
要讓 AI 搜尋讀到網頁,最基本要檢查什麼?
先看解答
先確認目標 crawler 能實際取得頁面。基本檢查包括 HTTP 200、沒有誤設 noindex、robots.txt 沒擋掉需要的 crawler、canonical 指向正確版本、主要正文直接出現在 HTML,而且頁面能從站內連結被找到。CDN 或 WAF 的 403、429 也要另外排查。
robots.txt 只是其中一層
實際抓取還會經過 DNS、CDN、WAF、rate limit 與應用程式本身。如果 robots.txt 寫 Allow,但伺服器最後回 403 或要求登入,爬蟲仍拿不到主要內容。
因此驗收最好直接用目標 URL 檢查回應狀態與 HTML,而不是只讀設定檔。核心內容若必須互動或登入後才載入,也會提高機器取得資訊的難度。