GEO baseline workflow 的第一個交付物,是一份可回查的 Day 0 基準,不是一張分數報表。這份基準要固定市場、語言、題目、引擎、日期與判讀規則,保存當時看到的回答和引用,並把尚未取得的資料、執行限制與人工判斷分開寫。這適用於接下來要動內容、而且想知道動完有沒有差別的團隊;題目、引擎或市場只要換過,那一輪就要另外分組,不能塞進同一張趨勢圖。本文提供的是可以照著做的東西:Day 0 要回答哪五個問題、六個建立步驟、最小資料欄位表、限制怎麼標,以及四個可以交接的 gate。
這件事跟交屋前拍屋況照片是同一個道理。沒拍,三個月後牆角出現裂縫,你分不出是原本就有還是後來弄的;拍了,至少大家爭論的是同一組照片。內容也一樣:十月改版完,AI 回答裡品牌出現了,那九月本來就會出現嗎?沒有 Day 0,這題沒有答案,只剩下印象。
本文聚焦 baseline 的建立與保存,不處理 prompt 版本治理,也不替後續內容改動設計實驗。把它當成一次觀測工作的起點:先把能重複的條件固定下來,再決定哪些資料需要持續追蹤。
baseline 應保留執行條件、回答、引用、狀態與限制,而不是只保存摘要。
Day 0 基準要回答什麼
Day 0 的意思不是「做之前一切都沒有」,而是把第一次有意識、說得清楚的觀測範圍保存下來。判斷標準很實際:交給一個沒參與這次執行的同事,他能不能回答這五個問題?
- 這次觀測看的是哪個市場、語言與品牌主題?
- 送出的題目是哪一版,為什麼選它們?
- 使用了哪些引擎和條件,執行日期是什麼?
- 看到的回答、引用 URL 和人工分類各是什麼?
- 哪些結果沒有取得、不能比較,或需要再次確認?
Google 的 AI features 文件把可抓取、索引資格與 AI 顯示分開說明,也提醒出現與否不由頁面作者單方面決定。所以基準記錄的是「這次觀測到什麼」;寫成「搜尋系統已經採用」或「頁面一定會出現」,就超出這份資料的範圍。Google AI features 官方說明
基準和目標要分開
基準是起始觀測,目標是團隊想改善或查明的問題。舉例來說,Day 0 發現品牌被描述成顧問服務、引用連到三年前的舊文、某個主題完全沒被提到——這三件都是待研究的現象,可以變成目標。
現象本身不會告訴你原因,起始結果也當不了內容品質總分。這兩步之間需要另外的查證。
基準和 prompt 治理要分開
Day 0 記錄送出的題目和版本,目的是讓這次觀測被看懂。至於題目怎麼審核、誰可以改、什麼時候退役,那是 prompt library governance 的長期工作,本文不展開那套權限與生命週期規則。需要處理這部分時,另看跨團隊 prompt 治理。
GEO baseline workflow 的六個步驟
步驟一:寫下基準範圍
開始執行前,先做一頁 scope card,寫上品牌或產品名稱、主要市場、語言、題目意圖、選用引擎、排除條件和執行日期。有裝置、地區或登入狀態等上下文,也一併標記。
要避開的是「全球」「全部問題」這種沒有分母的寫法——它們看起來涵蓋很廣,實際上讓人無從核對。
| 欄位 | 範例寫法 | 為什麼需要 |
|---|---|---|
| 市場 | 台灣;繁體中文 | 界定回答語境 |
| 題目主題 | 品牌認知、產品比較、服務選擇 | 方便之後按意圖分組 |
| 引擎 | 按這次實際執行清單列出 | 避免把不同引擎混成一筆 |
| 執行條件 | 日期、語言、裝置或其他上下文 | 讓後續比較有背景 |
| 排除條件 | 暫不判斷的題目與原因 | 防止排除範圍被遺忘 |
這張卡要防的是「同一組題目」在不同人手中變成不同意思。文件不必做得複雜,一頁就夠。
步驟二:設計最小可用題目組
健檢項目不是越多越好,是要選得出用途的那幾項。題目也是:以決策問題為單位,不要只收集品牌名稱。至少按認知、需求、比較、信任或服務流程等意圖分組,每組挑代表題。
每一題都要答得出兩件事:它為什麼存在,以及拿到回答後誰會用這個結果。答不出來的題目,通常就是那種跑了一輪、沒人看的題目。
題目要保留原文、版本、意圖和負責人。這還不是完整的題庫治理制度,而是 Day 0 需要的最低識別,確保回看時知道當初測了什麼。
步驟三:按同一條件執行並保存材料
執行時保存回答原文、引用 URL、引擎、日期、題目識別和執行狀態。
只取得摘要、畫面或部分結果時,在欄位裡說清楚是哪一種,別用自己的轉述把它補成完整回答——那一段補進去,之後沒有人分得出哪裡是原文。因錯誤、限制或空回應而沒拿到的資料,記下原因和再次確認的方法。
baseline 題目應保留原文、版本、意圖與執行條件,才能在後續回看時核對範圍。
步驟四:做最小人工分類
人工分類是為了讓後續工作找得到證據,不是把一段複雜回答壓成一個看似客觀的總分。可以先記這五件事:
- 品牌是否在回答中被直接提及。
- 描述是否符合已核對的品牌事實。
- 是否出現可查的引用 URL。
- 引用是否與回答的主張有關。
- 哪些部分需要內容、SEO、產品或法務角色再判讀。
「被提及」和「被推薦」要分開記。要算比例的話,先定義分母、題目單位、引擎範圍和排除規則;20 題裡 3 題執行失敗,分母寫 17 還是 20,是兩個不同的數字。品牌提及率也不等於各平台通用的 SOV,更不能和流量或轉換混在一起看。
步驟五:封存基準包
把 scope card、題目清單、回答、引用、人工分類、執行狀態與限制放進同一個可識別的基準包。檔名或識別碼帶上日期與範圍,但別只靠檔名判斷內容,文件裡仍要寫完整欄位。
基準包完成後,套一條規則:不可悄悄覆寫。會計傳票不用立可白改,要開紅字沖銷,Day 0 也一樣——修正錯字或分類要留修訂原因和前後差異;要加新題目就另列新增日期,不直接改寫原來那一版。
步驟六:寫出交接摘要
最後用一頁摘要告訴下一個角色:這次觀測涵蓋什麼、看到哪些可查現象、哪些還待確認、下一步可以做什麼,以及哪些事情不該由這份基準推出來。
摘要要能連回原始證據。只留結論的摘要,下一個人接手時還是得從頭跑一次。
基準資料應保存哪些欄位
以下欄位可以當作最小資料模型。實際工具或表格不必長得一樣,重點是每一欄的意義不被省略。
| 分類 | 最小欄位 | 讀者可以核對的問題 |
|---|---|---|
| 範圍 | 市場、語言、題目主題、引擎 | 這筆結果屬於哪個範圍? |
| 題目 | 題目原文、識別、版本、意圖 | 當時送出的是什麼? |
| 執行 | 日期、條件、狀態、錯誤 | 這次真的完成了嗎? |
| 回答 | 原文或可核對材料、人工摘要 | 摘要有沒有超出原文? |
| 引用 | URL、頁面標題、相關性註記 | 主張與來源如何連起來? |
| 判讀 | 提及、描述正確性、待查問題 | 哪些是事實,哪些是編輯判斷? |
| 保存 | 基準識別、檔案位置、修訂記錄 | 下次能否找到同一批材料? |
Google 的生成式 AI optimization guide 目前說明 Search Console 有 Generative AI performance report;那是 Google 自有搜尋資料的報告脈絡,和跨引擎的回答與引用觀測屬於不同資料層。建基準時要在欄位裡標明每一筆資料是 Search Console、工具觀測還是人工查閱,三種來源混成同一個指標之後,數字就解釋不動了。Google AI optimization guide
如何標示限制與不能比較的結果
好的 baseline 把限制寫在結果旁邊,而不是藏在文件最後。下列情形都值得獨立標記:
- 題目改過,前後兩次不能視為同一條件。
- 引擎、語言或市場不同,只能分組解讀。
- 回答只取得摘要或畫面,缺少完整原文。
- 引用 URL 變更、失效或無法回查。
- 執行中斷、資料延遲或部分完成。
- 人工尚未核對品牌事實或引用相關性。
抽血那天忘了空腹,那一項是無效,不是 0。觀測也是:「尚未取得」和「尚未判讀」都該保留成狀態,等下一次有可查證的材料再決定要不要納入趨勢。
技術政策也會改變基準的解讀方式。Google 在官方更新中說明,FAQ rich result 自 2026 年 5 月 7 日起不再顯示;同一系列更新也澄清,llms.txt 不需要用於 Google Search,不會帶來正面或負面的搜尋可見度影響。基準包若記錄了結構化資料或 llms.txt 的工作,把「檔案存在」和「Google 是否顯示或採用」分成兩欄,並保存政策查閱日期。Google Search 文件更新
何時可以把基準交給下一個角色
交屋會有點交清單,基準包也可以用四個 gate 判斷交不交得出去:
- 範圍 gate:市場、語言、題目、引擎與日期已列出。
- 證據 gate:代表性結果可回到回答、引用和執行狀態。
- 判讀 gate:事實、人工分類、推論和未知限制有分開。
- 行動 gate:下一步有責任角色,且沒有把未證實結果寫成承諾。
四項都過了才算可交接。少了證據 gate,下一個人看到的是結論;少了判讀 gate,他會把你的編輯判斷當成事實往下用。
如果你要先比較工具怎麼展示這些證據,可讀 GEO 工具評估框架。正在處理自建與採用的資料責任,可以讀 AI 搜尋監測工具的配置取捨;採購前的權限和保存問題則參考 AI 搜尋監測工具採購清單。
常見問題
GEO baseline 一定要有一個總分嗎?
可以先不要。總分讓摘要變方便,代價是題目、引擎、引用和人工判斷的差異全被壓平——分數從 62 變 58,沒有人說得出是哪一題、哪個引擎在動。先保存可回查證據和限制,之後真的需要摘要指標時再定義清楚。
Day 0 應該觀測多少題目?
沒有一個不用看情境的固定數字。題數要能覆蓋你的核心意圖,也要讓團隊保存和判讀得完每一筆材料。從有明確用途的最小題目組開始、把排除範圍記下來,通常比一次鋪 200 題更容易維持品質。
基準建立後可以修改題目嗎?
可以改,條件是保留原題目、版本、修改原因和生效日期。新增或改寫題目都算新條件,靜默覆蓋 Day 0 之後,後續差異就沒辦法解釋了。
一次觀測看不到品牌,是否等於品牌沒有可見度?
這只能說:在指定的題目、引擎、時間和條件下,那次回答沒有看到可記錄的品牌提及。還要回頭確認題目適不適合、資料完不完整、回答有沒有執行成功,以及其他條件要不要分開觀測。跑一輪、品牌沒出現就下結論,通常只是題目寫得不對。
基準可以直接當成 SEO 成效報告嗎?
兩份報告分開放。GEO 基準保存的是 AI 回答與引用觀測,SEO 報告可能包含搜尋曝光、點擊或 Search Console 的生成式 AI 報告。資料來源、分母、日期和適用產品都不同,併成一張表會讓兩邊都失真。
結語
GEO baseline workflow 的價值,在於讓團隊知道自己從哪個範圍、哪批題目和哪一組證據開始。先固定條件、保存原始材料、標記限制,再把可查現象交給內容或網站角色處理,後續才有東西可比。基準是工作起點,對品牌或搜尋結果沒有保證作用;若要討論實際範圍,可到 EthorX 聯絡頁提供需求,正式交付仍以核對後的範圍與責任為準。
若要把 Day 0 觀測放回服務範圍,可看 GEO 服務頁;若要了解產品如何呈現觀測,參考 Otlex 產品頁。
查證邊界
本文查證日期為 2026-09-21。Google AI features 文件支持可抓取、索引資格與 AI 顯示應分開記錄;Google AI optimization guide 支持 Search Console 生成式 AI performance report 屬於 Google 自有搜尋資料脈絡;Google Search 更新頁支持 FAQ rich result 自 2026-05-07 起的現行狀態與 llms.txt 不需用於 Google Search 的邊界。這些 Google 文件不支持任何第三方工具的產品有效性或客戶結果。文中的 20 題、17 筆、62 分與交屋、健檢等情境都是說明用的假設案例,不是實測結果。Otlex 畫面是示範帳戶資料,僅用來說明欄位,不代表客戶成果,也不單獨證明因果效益;本文的 Day 0 欄位、保存流程與交接 gate 是編輯方法建議,實際方案欄位仍應按當日產品文件或帳號核對。
參考來源
- Google Search Central:AI features and your website(支持可抓取、索引資格與 AI 顯示邊界)
- Google Search Central:Optimizing your website for generative AI features(支持 Search Console 報告脈絡)
- Google Search Central:Latest documentation updates(支持 FAQ rich result 與 llms.txt 現況)
- EthorX:GEO 工具類別頁(僅作產品公開定位來源,不替基準資料或工具有效性背書)