假設一家 CNC 加工廠想讓客服 agent 回答客戶的規格問題。IT 主管的第一個反應是:「共用硬碟裡有十二年的檔案,先整理完再說。」半年後整理了三成,agent 還沒開始做。
另一種做法是先問:客服最常被問的是哪些問題?答案大概會用到四份文件:現行的材質規格表、公差標準、交期說明和退貨政策。這四份文件兩週就能整理完,agent 下個月就能開始試行。知識庫要整理的範圍,由第一個流程決定。
這篇講 agent 實際上怎麼讀你的文件、哪些資料問題最常讓它答錯,以及只替第一個流程準備資料時,要檢查的五件事。第一個流程怎麼挑,可以先看哪些企業流程適合先交給 AI agent。
agent 怎麼讀你的文件
大多數 agent 平台處理文件的方式很像:先把文件切成小段,轉成可以比對語意的格式存起來,使用者提問時,再找出最相關的幾段拿來回答。
OpenAI 的檔案檢索工具在文件放進向量資料庫(vector store)時,會自動切段、轉換與建立索引;預設每段約 800 個 token,前後段重疊 400 個 token。Google Cloud 的 Agent Search(原 Vertex AI Search)預設每段 500 個 token。檢索時用的是語意比對,就算提問和文件用詞不同,也能找到意思相近的段落。
不過料號、訂單編號這類字串,語意比對不一定抓得準。OpenAI 的檢索設定可以同時用語意比對與關鍵字比對,再調整兩者的比重。如果你的流程常要查「SO-0831」這種編號,選平台時可以先確認它支援關鍵字比對,或讓 agent 直接查訂單系統。
這個流程有一個容易被忽略的後果:文件被切成小段之後,每一段都要自己看得懂。Anthropic 在說明檢索改進方法時舉過一個例子:某一段寫著「公司營收比上一季成長 3%」,但這段本身沒說是哪家公司、哪一季。放回整份文件裡人看得懂,單獨被找出來時就失去了脈絡。
換成工廠的例子:規格表只在第一頁寫「本表適用於 6061 鋁合金」,後面幾十列都是尺寸與公差。被切出來的某一段只剩下一列數字,agent 拿到它時不一定知道是哪個材質。Anthropic 的做法是在每一段前面補上說明脈絡的文字,他們的測試裡,檢索前 20 段仍找不到正確內容的比例,從 5.7% 降到 3.7%,再加上關鍵字比對與重新排序,降到 1.9%。
一般公司不一定要自己做這種技術調整,但可以從文件端下手:表格每一頁都有表頭、每個段落開頭交代它在講什麼,效果是同一個方向。
用一個問題走一遍
假設客戶來信問:「6061 鋁件、孔徑 10 mm,你們的公差可以做到多少?」客服 agent 大致會這樣處理:
- 把問題改寫成幾個查詢,例如「6061 公差」「孔徑 10 mm 公差標準」。
- 從資料來源找出最相關的幾段,可能是公差標準的某一頁、規格表的某幾列。
- 讀這幾段,整理成回答,附上出處。
每一步都可能被資料本身拖累。公差標準如果有兩個版本,第二步可能拿到舊的那份;規格表如果是掃描檔,第二步什麼都找不到;表頭只在第一頁,第三步拿到的那一列數字就看不出是哪個材質。agent 答錯時,先回頭看它拿到了哪幾段,很多時候,問題就出在資料。
最常讓 agent 答錯的五種資料問題
下面五種問題,在各家平台的文件裡都看得到對應的限制。
1. 同一份文件有好幾個版本
「規格表_v3」「規格表_v3_final」「規格表_最新」同時放在資料夾裡,agent 可能找到任何一個。它沒辦法從檔名判斷哪個是現行版,答出舊規格的機率就很高。
2. 掃描檔與圖片裡的文字
Google 的文件說明,數位解析器只抽取機器可讀的文字;掃描的 PDF、文字在圖片裡的文件,要改用 OCR 解析器。很多工廠的檢驗標準是紙本掃描,放進去之後,agent 可能根本讀不到內容。例如一份十年前掃描的熱處理規範,人眼看得很清楚,對只讀文字的解析器來說,可能只是一張沒有字的圖。
3. 權限沒有對齊
Microsoft Copilot Studio 用使用者自己的身分讀取 SharePoint 等資料來源,agent 只會找出這位使用者有權限看的內容。它的疑難排解文件特別提醒:使用者缺少權限時,系統不會報錯,看起來就像找不到文件。權限問題常常偽裝成「agent 答不出來」,測試時要用實際使用者的帳號測。
4. 加密或設了密碼的檔案
同一份 Microsoft 文件也提到,套用加密的敏感度標籤、雙金鑰加密或設了密碼的檔案,agent 無法讀取內容;這些檔案可能在知識來源清單裡顯示為「就緒」,問到時卻沒有回應。
5. 沒有人負責更新
交期說明改了,網站和業務都知道,放在 agent 資料來源裡的那份卻還是舊的。文件沒有負責人,就沒有人會記得去更新它。
| 資料問題 | agent 會怎樣 | 改法 |
|---|---|---|
| 多個版本並存 | 可能引用舊版內容 | 只留現行版,舊版移到封存區 |
| 掃描檔、圖片 | 讀不到或讀錯文字 | 轉成文字檔,或確認平台有 OCR |
| 權限沒對齊 | 看起來像「找不到資料」 | 用實際使用者帳號測試 |
| 加密或密碼保護 | 顯示就緒卻沒有回應 | 另放一份可讀的版本到授權位置 |
| 沒有負責人 | 答出過期資訊 | 每份文件指定負責人與確認日期 |
只替第一個流程準備:五項清單
整理資料像分豆子:只替這一罐分好、貼上標籤,其他的等要用時再分。
挑好第一個流程之後,照下面的順序準備資料。
- 列出這個流程會用到的文件與系統。以客服規格問答為例,就是那四份文件,加上訂單系統。清單以外的資料這一輪先不動。
- 只留現行版本。每份文件只保留一個版本在 agent 讀得到的位置,舊版移到封存區。
- 寫上負責人與最後確認日期。建議每份文件至少記四個欄位:負責人、最後確認日期、適用範圍(例如哪些材質、哪條產品線)、可讀取的人員群組。這些欄位可以寫在文件開頭,也可以用平台的欄位記。例如 OpenAI 的向量資料庫允許每個檔案帶最多 16 個自訂屬性,檢索時可以依屬性篩選,例如只找某個日期之後的文件。
- 權限照原本的規則走。原本只有業務主管能看的報價底價,agent 也不該讓其他人讀到。涉及客戶個資的文件,也要回頭確認用途:個人資料保護法第 5 條要求個資的利用不得逾越特定目的的必要範圍,拿來當 agent 的資料來源之前,先確認符合當初蒐集的目的。
- 讓每一段自己看得懂。表格每頁都有表頭,段落開頭交代主題,掃描檔轉成文字。讓人容易查的文件,通常 agent 也容易用。
整理完之後,準備一組固定的測試問題,例如客服最常被問的 20 題,每題寫下正確答案與出處。試行時用這組問題測,才知道 agent 答對多少、錯在哪裡。驗收方式可以看 AI agent 專案怎麼驗收。
資料量小的時候,可以更簡單
不是每個流程都需要建一套檢索系統。Anthropic 的建議是,如果知識庫小於 20 萬個 token(大約 500 頁),可以直接把整份內容放進給模型的提示裡,不需要檢索。
以那四份客服文件來說,就算加起來有二、三十頁,也遠低於 500 頁這個量。這時與其花時間調整切段方式,不如把四份文件整理得清楚、一致。
反過來,如果需求只是讓同事查規格、問政策,沒有要 agent 去操作系統,Microsoft 的 agent 導入指南認為用檢索增強生成(RAG)的問答就夠,不需要做成 agent。兩者的差別可以看 AI agent 和聊天機器人、RPA 的差別。
上線後怎麼維護
資料整理完不是一次性的工作。我建議把下面三件事排進例行流程:
- 文件改版時,同步更新 agent 的資料來源。在原本的改版流程裡多加一步,例如交期說明改版,負責人要確認 agent 讀的那份也換了。
- 搬移或改名前先確認連結。Microsoft 的文件提到,把 SharePoint 網站或資料夾改名,可能讓 agent 原本的資料來源連結失效,agent 就讀不到了。
- 每月用固定測試題抽查一次。答案和上個月不同時,先查是文件改了、權限變了,還是連結斷了。
這三件事最好指定一位資料窗口負責,通常是這個流程的主管或資深同事。例如某個月抽查時,20 題裡有 2 題答案和上個月不同,資料窗口要能在一天內查出是哪份文件改版、有沒有同步到 agent,這套維護才算真的在運作。
資料整理解決不了的事
資料整理得再好,agent 還是可能答錯。Microsoft 在 Copilot Studio 的說明裡提到,就算關閉「允許不依據資料來源回答」的設定,模型在整合檢索結果時仍可能混入一般知識。所以會對客戶承諾的內容,例如交期、價格、品質判定,仍要保留人工確認;怎麼分級,可以看 AI agent 的權限與人工確認怎麼設。
我建議一開始就要求 agent 回答時附上出處,指出答案來自哪份文件的哪一段。Copilot Studio 在限制只依資料來源回答時,也是用回答裡有沒有引用出處來判斷;少了出處的正確答案,有時反而會被擋下。附出處的好處是,客服人員確認時一眼就能回到原文核對。
另外,各平台支援的檔案格式與大小上限不同。例如 OpenAI 檔案檢索的支援清單裡沒有 Excel,Google 的 Agent Search 則支援 XLSX;單檔上限也各有規定。選平台前,以官方文件當下的清單為準。
接下來可以看什麼
資料準備好之後,下一步通常是決定 agent 能做到哪裡。例如客服 agent 找到答案之後,是直接回覆客戶,還是先給客服人員確認?這要看權限設計與驗收標準:
不必等資料全部整理好
例如你手上只有一個十幾年的共用硬碟、幾份散在業務電腦裡的 Excel,也可以開始。我們的企業 AI 營運方案不要求企業先把全公司資料整頓完畢。需求診斷時,工程團隊會到現場協助梳理資料現況,挑出最有價值的關鍵流程切入,接著進行系統串接、在真實業務中驗證上線,並持續維護。
常見問題
一定要先建一套「企業知識庫系統」嗎?
不一定。第一個流程只用到幾份文件時,把它們整理好、放在 agent 讀得到的位置就能開始。等流程變多、文件變多,再考慮統一的知識庫系統,那時你也會更清楚需要什麼功能。
掃描的 PDF 可以直接給 agent 用嗎?
要先確認平台能不能讀出裡面的文字。Google 的文件說明,掃描檔要用 OCR 解析器才能抽出文字。最穩的做法是把常用的掃描文件轉成文字檔,再核對一次數字與表格有沒有轉錯。
agent 會讓員工看到原本沒有權限看的文件嗎?
要看 agent 用誰的身分讀資料。Copilot Studio 這類用使用者本人身分讀取的設計,只會找出這位使用者本來就能看的內容。如果 agent 用一個權限很大的共用帳號讀資料,就可能出現越權,設計時要先確認這一點。
資料多久要更新一次?
跟著文件本身的改版走,而不是固定週期。規格表改版、政策調整時,負責人同步更新 agent 的資料來源;另外每月用固定測試題抽查一次,找出漏掉的更新。
Excel 表格適合當 agent 的資料嗎?
看平台與用途。OpenAI 檔案檢索的支援清單沒有 Excel,Google 的 Agent Search 支援 XLSX。如果要查的是數字,例如某張訂單的數量或某個料號的庫存,讓 agent 直接查資料庫或表格工具,通常比把表格切段檢索更準確。
參考來源
以下依各家官方文件整理,支援格式與上限以官方頁面當下為準。
- OpenAI:File search
- OpenAI:Retrieval
- Anthropic:Introducing Contextual Retrieval
- Google Cloud:Parse and chunk documents(Agent Search)
- Microsoft Learn:Knowledge sources summary(Copilot Studio)
- Microsoft Learn:SharePoint knowledge sources don’t return results
- Microsoft Learn:Business plan for AI agents
- 全國法規資料庫:個人資料保護法第 5 條