企業知識庫要整理到什麼程度,AI agent 才用得上?

很多公司以為導入 AI agent 前,要先把全公司資料整理完。這篇說明 agent 怎麼讀文件、最常答錯的五種資料問題,以及只替第一個流程準備資料的清單。

先說結論

不必等全公司資料整理完。我建議只整理第一個流程會用到的那批資料,確認五件事:只留現行版本、每份文件有負責人、權限和原本的存取規則一致、格式讀得出文字、過期時有人下架或更新。做到這五項就能開始試行,其他資料等下一個流程需要時再整理。

雜亂的檔案架前,一台小推車上只放著幾本整理整齊的資料夾
企業知識庫要整理到什麼程度,AI agent 才用得上? 封面視覺

假設一家 CNC 加工廠想讓客服 agent 回答客戶的規格問題。IT 主管的第一個反應是:「共用硬碟裡有十二年的檔案,先整理完再說。」半年後整理了三成,agent 還沒開始做。

另一種做法是先問:客服最常被問的是哪些問題?答案大概會用到四份文件:現行的材質規格表、公差標準、交期說明和退貨政策。這四份文件兩週就能整理完,agent 下個月就能開始試行。知識庫要整理的範圍,由第一個流程決定。

這篇講 agent 實際上怎麼讀你的文件、哪些資料問題最常讓它答錯,以及只替第一個流程準備資料時,要檢查的五件事。第一個流程怎麼挑,可以先看哪些企業流程適合先交給 AI agent。

agent 怎麼讀你的文件

大多數 agent 平台處理文件的方式很像:先把文件切成小段,轉成可以比對語意的格式存起來,使用者提問時,再找出最相關的幾段拿來回答。

OpenAI 的檔案檢索工具在文件放進向量資料庫(vector store)時,會自動切段、轉換與建立索引;預設每段約 800 個 token,前後段重疊 400 個 token。Google Cloud 的 Agent Search(原 Vertex AI Search)預設每段 500 個 token。檢索時用的是語意比對,就算提問和文件用詞不同,也能找到意思相近的段落。

不過料號、訂單編號這類字串,語意比對不一定抓得準。OpenAI 的檢索設定可以同時用語意比對與關鍵字比對,再調整兩者的比重。如果你的流程常要查「SO-0831」這種編號,選平台時可以先確認它支援關鍵字比對,或讓 agent 直接查訂單系統。

這個流程有一個容易被忽略的後果:文件被切成小段之後,每一段都要自己看得懂。Anthropic 在說明檢索改進方法時舉過一個例子:某一段寫著「公司營收比上一季成長 3%」,但這段本身沒說是哪家公司、哪一季。放回整份文件裡人看得懂,單獨被找出來時就失去了脈絡。

換成工廠的例子:規格表只在第一頁寫「本表適用於 6061 鋁合金」,後面幾十列都是尺寸與公差。被切出來的某一段只剩下一列數字,agent 拿到它時不一定知道是哪個材質。Anthropic 的做法是在每一段前面補上說明脈絡的文字,他們的測試裡,檢索前 20 段仍找不到正確內容的比例,從 5.7% 降到 3.7%,再加上關鍵字比對與重新排序,降到 1.9%。

一般公司不一定要自己做這種技術調整,但可以從文件端下手:表格每一頁都有表頭、每個段落開頭交代它在講什麼,效果是同一個方向。

用一個問題走一遍

假設客戶來信問:「6061 鋁件、孔徑 10 mm,你們的公差可以做到多少?」客服 agent 大致會這樣處理:

  1. 把問題改寫成幾個查詢,例如「6061 公差」「孔徑 10 mm 公差標準」。
  2. 從資料來源找出最相關的幾段,可能是公差標準的某一頁、規格表的某幾列。
  3. 讀這幾段,整理成回答,附上出處。

每一步都可能被資料本身拖累。公差標準如果有兩個版本,第二步可能拿到舊的那份;規格表如果是掃描檔,第二步什麼都找不到;表頭只在第一頁,第三步拿到的那一列數字就看不出是哪個材質。agent 答錯時,先回頭看它拿到了哪幾段,很多時候,問題就出在資料。

最常讓 agent 答錯的五種資料問題

下面五種問題,在各家平台的文件裡都看得到對應的限制。

1. 同一份文件有好幾個版本

「規格表_v3」「規格表_v3_final」「規格表_最新」同時放在資料夾裡,agent 可能找到任何一個。它沒辦法從檔名判斷哪個是現行版,答出舊規格的機率就很高。

2. 掃描檔與圖片裡的文字

Google 的文件說明,數位解析器只抽取機器可讀的文字;掃描的 PDF、文字在圖片裡的文件,要改用 OCR 解析器。很多工廠的檢驗標準是紙本掃描,放進去之後,agent 可能根本讀不到內容。例如一份十年前掃描的熱處理規範,人眼看得很清楚,對只讀文字的解析器來說,可能只是一張沒有字的圖。

3. 權限沒有對齊

Microsoft Copilot Studio 用使用者自己的身分讀取 SharePoint 等資料來源,agent 只會找出這位使用者有權限看的內容。它的疑難排解文件特別提醒:使用者缺少權限時,系統不會報錯,看起來就像找不到文件。權限問題常常偽裝成「agent 答不出來」,測試時要用實際使用者的帳號測。

4. 加密或設了密碼的檔案

同一份 Microsoft 文件也提到,套用加密的敏感度標籤、雙金鑰加密或設了密碼的檔案,agent 無法讀取內容;這些檔案可能在知識來源清單裡顯示為「就緒」,問到時卻沒有回應。

5. 沒有人負責更新

交期說明改了,網站和業務都知道,放在 agent 資料來源裡的那份卻還是舊的。文件沒有負責人,就沒有人會記得去更新它。

資料問題agent 會怎樣改法
多個版本並存可能引用舊版內容只留現行版,舊版移到封存區
掃描檔、圖片讀不到或讀錯文字轉成文字檔,或確認平台有 OCR
權限沒對齊看起來像「找不到資料」用實際使用者帳號測試
加密或密碼保護顯示就緒卻沒有回應另放一份可讀的版本到授權位置
沒有負責人答出過期資訊每份文件指定負責人與確認日期

只替第一個流程準備:五項清單

食品櫃層板上,左邊玻璃罐裝著混雜的豆子,中間的篩網與漏斗正在分揀,右邊玻璃罐只剩一種豆子並掛著空白標籤 整理資料像分豆子:只替這一罐分好、貼上標籤,其他的等要用時再分。

挑好第一個流程之後,照下面的順序準備資料。

  1. 列出這個流程會用到的文件與系統。以客服規格問答為例,就是那四份文件,加上訂單系統。清單以外的資料這一輪先不動。
  2. 只留現行版本。每份文件只保留一個版本在 agent 讀得到的位置,舊版移到封存區。
  3. 寫上負責人與最後確認日期。建議每份文件至少記四個欄位:負責人、最後確認日期、適用範圍(例如哪些材質、哪條產品線)、可讀取的人員群組。這些欄位可以寫在文件開頭,也可以用平台的欄位記。例如 OpenAI 的向量資料庫允許每個檔案帶最多 16 個自訂屬性,檢索時可以依屬性篩選,例如只找某個日期之後的文件。
  4. 權限照原本的規則走。原本只有業務主管能看的報價底價,agent 也不該讓其他人讀到。涉及客戶個資的文件,也要回頭確認用途:個人資料保護法第 5 條要求個資的利用不得逾越特定目的的必要範圍,拿來當 agent 的資料來源之前,先確認符合當初蒐集的目的。
  5. 讓每一段自己看得懂。表格每頁都有表頭,段落開頭交代主題,掃描檔轉成文字。讓人容易查的文件,通常 agent 也容易用。

整理完之後,準備一組固定的測試問題,例如客服最常被問的 20 題,每題寫下正確答案與出處。試行時用這組問題測,才知道 agent 答對多少、錯在哪裡。驗收方式可以看 AI agent 專案怎麼驗收。

資料量小的時候,可以更簡單

不是每個流程都需要建一套檢索系統。Anthropic 的建議是,如果知識庫小於 20 萬個 token(大約 500 頁),可以直接把整份內容放進給模型的提示裡,不需要檢索。

以那四份客服文件來說,就算加起來有二、三十頁,也遠低於 500 頁這個量。這時與其花時間調整切段方式,不如把四份文件整理得清楚、一致。

反過來,如果需求只是讓同事查規格、問政策,沒有要 agent 去操作系統,Microsoft 的 agent 導入指南認為用檢索增強生成(RAG)的問答就夠,不需要做成 agent。兩者的差別可以看 AI agent 和聊天機器人、RPA 的差別。

上線後怎麼維護

資料整理完不是一次性的工作。我建議把下面三件事排進例行流程:

  • 文件改版時,同步更新 agent 的資料來源。在原本的改版流程裡多加一步,例如交期說明改版,負責人要確認 agent 讀的那份也換了。
  • 搬移或改名前先確認連結。Microsoft 的文件提到,把 SharePoint 網站或資料夾改名,可能讓 agent 原本的資料來源連結失效,agent 就讀不到了。
  • 每月用固定測試題抽查一次。答案和上個月不同時,先查是文件改了、權限變了,還是連結斷了。

這三件事最好指定一位資料窗口負責,通常是這個流程的主管或資深同事。例如某個月抽查時,20 題裡有 2 題答案和上個月不同,資料窗口要能在一天內查出是哪份文件改版、有沒有同步到 agent,這套維護才算真的在運作。

資料整理解決不了的事

資料整理得再好,agent 還是可能答錯。Microsoft 在 Copilot Studio 的說明裡提到,就算關閉「允許不依據資料來源回答」的設定,模型在整合檢索結果時仍可能混入一般知識。所以會對客戶承諾的內容,例如交期、價格、品質判定,仍要保留人工確認;怎麼分級,可以看 AI agent 的權限與人工確認怎麼設。

我建議一開始就要求 agent 回答時附上出處,指出答案來自哪份文件的哪一段。Copilot Studio 在限制只依資料來源回答時,也是用回答裡有沒有引用出處來判斷;少了出處的正確答案,有時反而會被擋下。附出處的好處是,客服人員確認時一眼就能回到原文核對。

另外,各平台支援的檔案格式與大小上限不同。例如 OpenAI 檔案檢索的支援清單裡沒有 Excel,Google 的 Agent Search 則支援 XLSX;單檔上限也各有規定。選平台前,以官方文件當下的清單為準。

接下來可以看什麼

資料準備好之後,下一步通常是決定 agent 能做到哪裡。例如客服 agent 找到答案之後,是直接回覆客戶,還是先給客服人員確認?這要看權限設計與驗收標準:

不必等資料全部整理好

例如你手上只有一個十幾年的共用硬碟、幾份散在業務電腦裡的 Excel,也可以開始。我們的企業 AI 營運方案不要求企業先把全公司資料整頓完畢。需求診斷時,工程團隊會到現場協助梳理資料現況,挑出最有價值的關鍵流程切入,接著進行系統串接、在真實業務中驗證上線,並持續維護。

常見問題

一定要先建一套「企業知識庫系統」嗎?

不一定。第一個流程只用到幾份文件時,把它們整理好、放在 agent 讀得到的位置就能開始。等流程變多、文件變多,再考慮統一的知識庫系統,那時你也會更清楚需要什麼功能。

掃描的 PDF 可以直接給 agent 用嗎?

要先確認平台能不能讀出裡面的文字。Google 的文件說明,掃描檔要用 OCR 解析器才能抽出文字。最穩的做法是把常用的掃描文件轉成文字檔,再核對一次數字與表格有沒有轉錯。

agent 會讓員工看到原本沒有權限看的文件嗎?

要看 agent 用誰的身分讀資料。Copilot Studio 這類用使用者本人身分讀取的設計,只會找出這位使用者本來就能看的內容。如果 agent 用一個權限很大的共用帳號讀資料,就可能出現越權,設計時要先確認這一點。

資料多久要更新一次?

跟著文件本身的改版走,而不是固定週期。規格表改版、政策調整時,負責人同步更新 agent 的資料來源;另外每月用固定測試題抽查一次,找出漏掉的更新。

Excel 表格適合當 agent 的資料嗎?

看平台與用途。OpenAI 檔案檢索的支援清單沒有 Excel,Google 的 Agent Search 支援 XLSX。如果要查的是數字,例如某張訂單的數量或某個料號的庫存,讓 agent 直接查資料庫或表格工具,通常比把表格切段檢索更準確。

參考來源

以下依各家官方文件整理,支援格式與上限以官方頁面當下為準。

從這篇繼續看相關內容

依文章主題整理同站文章、服務/產品與 FAQ 入口,讓下一步有清楚的閱讀方向。

延伸閱讀

下一步

服務入口

了解企業 AI 營運導入

從需求診斷、系統串接、驗證上線到持續維護,查看 AI agent 導入的分工與人工審核方式。

查看相關頁面

常見問題

AI agent 可以不經人確認直接寄信嗎?

依能不能復原、影響誰、有沒有對外承諾,決定哪些動作要人確認。

查看 FAQ 解答

企業 AI 落地實踐

把文章裡的判斷帶回你的流程

從一個實際工作流開始,與 EthorX 共同釐清 AI agents 的導入起點。