網站實作

要讓 AI 搜尋讀到網頁,最基本要檢查什麼?

先看解答

先確認目標 crawler 能實際取得頁面。基本檢查包括 HTTP 200、沒有誤設 noindex、robots.txt 沒擋掉需要的 crawler、canonical 指向正確版本、主要正文直接出現在 HTML,而且頁面能從站內連結被找到。CDN 或 WAF 的 403、429 也要另外排查。

robots.txt 只是其中一層

實際抓取還會經過 DNS、CDN、WAF、rate limit 與應用程式本身。如果 robots.txt 寫 Allow,但伺服器最後回 403 或要求登入,爬蟲仍拿不到主要內容。

因此驗收最好直接用目標 URL 檢查回應狀態與 HTML,而不是只讀設定檔。核心內容若必須互動或登入後才載入,也會提高機器取得資訊的難度。

參考來源

  1. Google Search Central:AI features and your website(另開分頁)
  2. OpenAI Developers:Overview of OpenAI Crawlers(另開分頁)
回到網站實作