會議上老闆問:「我們是不是也該訓練一個自己的 LLM?」IT 同事想了一下,說要先查查看。散會後大家各自去搜尋,看到的是 GPT、Gemini、生成式 AI、RAG、agent 一整串名詞,越看越不確定這題該從哪裡回答。
這題我的答案通常是:先不用。可是要講清楚為什麼不用,得先知道 LLM 到底是什麼、它怎麼產生答案、會在哪裡出錯。弄懂這幾件事,後面要不要加 RAG、要不要做 agent、資料能不能放進去,才判斷得下去。
LLM 是什麼:用大量文字訓練出來的語言模型
LLM 是 Large Language Model 的縮寫,中文叫「大型語言模型」。AWS 的定義是:以大量資料預先訓練、非常大型的深度學習模型。Google Cloud 的說法更直接:一種用大量資料訓練的統計語言模型,可以生成、翻譯文字,處理各種自然語言工作。
「大型」指兩件事。一是訓練資料多,AWS 舉的例子是 Common Crawl 這類網頁資料集,收錄的網頁超過 500 億頁;二是模型本身的參數多,GPT-3 有 1,750 億個參數。參數可以想成模型內部上千億個可調整的旋鈕,訓練的過程就是把這些旋鈕一點一點調到位。
Cloudflare 把 LLM 放在機器學習、深度學習和生成式 AI 的交會處:它用深度學習的方法訓練,產出的是新生成的文字,所以屬於生成式 AI 的一種。你每天打開的 ChatGPT、Claude、Gemini,都是建在 LLM 上面的產品。
LLM 怎麼運作:把文字切成 token,一次預測一個
LLM 產生回答的方式,比多數人想像的單純:它看著目前為止的文字,猜下一小段最可能是什麼,接上去,再猜下一段,一路接到回答結束。
先把文字切成 token
模型讀的是 token。OpenAI 的說明是,一個 token 可能是一個字元、半個單字、一整個單字或一個標點。英文大約 4 個字元一個 token,約等於四分之三個單字;Google 的 Gemini 文件也寫 100 個 token 大約是 60 到 80 個英文字。
中文的換算比例和英文不同,OpenAI 也提醒每種語言的字數和 token 關係不一樣。token 和兩件事直接相關:
- 費用:API 通常按輸入與輸出的 token 數計價,輸出往往比輸入貴。
- 上限:每個模型一次能處理的 token 數有上限,稱為上下文長度(context window)。
所以要估成本,我建議拿一份你們真正會丟進去的文件,例如一張報價單加上規格表,用官方的 token 計算工具實際算一次,比套用英文的換算公式可靠。
一次預測一個 token
AWS 描述訓練過程時寫得很清楚:模型反覆調整參數,直到它能根據前面的 token 正確預測下一個 token。這就是 LLM 的核心能力。
讓它能看懂一長段文字的,是 2017 年 Google 研究團隊在論文〈Attention Is All You Need〉提出的 Transformer 架構。它用一種叫自注意力(self-attention)的機制,讓模型在處理每個字時,同時看整段文字裡其他字跟它的關係。「這個價格含稅嗎」裡的「這個」指哪一個價格,靠的就是這種關聯。
NIST 在生成式 AI 風險框架裡點出這套做法的另一面:模型產出的是近似訓練資料統計分布的內容,所以同一種機制可以生出正確的句子,也可以生出流暢但錯誤的句子。LLM 產生的是「最可能接下去的文字」,事實正確與否要另外把關。
預訓練之後,還要教它聽指令
只會預測下一個 token 的模型,你問它「幫我寫一封延遲出貨的道歉信」,它可能接著寫出另一個問題,因為網路上的文字常常是這樣接的。要變成能對話、能照指示做事的助手,還要再訓練幾輪。
OpenAI 2022 年的 InstructGPT 論文是這一步的代表做法:
| 階段 | 在做什麼 | 效果 |
|---|---|---|
| 預訓練 | 用大量文字學會預測下一個 token | 學會語言、常識和大量知識 |
| 指令微調 | 用人寫的「指令+理想回答」範例再訓練 | 學會照指令回答 |
| 人類回饋強化學習(RLHF) | 請人替多個回答排序,讓模型往較好的方向調整 | 回答更有幫助,較少捏造與有害內容 |
論文裡有個結果很有意思:經過這兩步調整、只有 13 億參數的模型,回答比 1,750 億參數、未經調整的 GPT-3 更受評分者偏好。模型好不好用,參數大小只是其中一個條件。

LLM、生成式 AI、ChatGPT 和 AI agent 的關係
這幾個名詞常被混在一起講,其實是不同層次的東西:
| 名詞 | 是什麼 | 例子 |
|---|---|---|
| 生成式 AI | 能產生新內容的 AI 總稱,包含文字、圖片、聲音 | 寫文案、生成圖片、合成語音 |
| LLM | 生成式 AI 裡專門處理文字的模型 | GPT、Claude、Gemini、Gemma |
| 聊天產品 | 把 LLM 包成介面給人直接用 | ChatGPT、Claude、Gemini App |
| RAG | 回答前先查你的文件,讓 LLM 依資料作答 | 內部知識庫問答 |
| AI agent | 由 LLM 決定下一步、呼叫工具完成多步驟工作 | 查訂單、草擬回覆、等人確認後寄出 |
LLM 是引擎,其他都是用這顆引擎組出來的東西。例如要讓它查公司文件,做法是 RAG;要讓它連上 ERP、CRM 這些系統,常見的標準是 MCP。
要讓它自己決定下一步、完成一整段工作,就是 agent,和聊天機器人、RPA 的差別可以看 AI agent 和聊天機器人、RPA、自動化流程差在哪。
LLM 擅長什麼,會在哪裡出錯
LLM 最擅長處理「文字進、文字出」的工作,例如摘要一封長信、把會議紀錄整理成待辦、改寫成不同語氣、從一段描述抽出品名和數量、把技術文件翻成業務看得懂的說法。這些工作過去要一個人花半小時,現在幾秒鐘就有草稿。
限制也很具體,我把企業最常踩到的四個列出來:
知識停在訓練資料的截止日
模型只知道訓練資料裡有的東西。Anthropic 的模型總覽表會同時列出兩個日期:「可靠知識截止」是模型知識最完整可靠的時間點,「訓練資料截止」是訓練資料涵蓋的較大範圍。問它上個月的新法規、你們這季的新產品,它不知道,還可能用舊資訊回答。
上下文有上限,塞越多不一定越好
Anthropic 把上下文長度形容為模型的「工作記憶」,和訓練資料是兩回事:你在對話裡貼的文件、先前的對話、模型的回答,全都算在這個額度裡。它也提醒,token 越多,模型找回與記住細節的準確度會下降。挑對要放進去的內容,比放得越多越好。agent 每一步該放哪些資料,在 Context Engineering 是什麼 有完整做法。
會流暢地講錯
NIST 把這種現象稱為 confabulation,一般說的「AI 幻覺」:自信地產出錯誤或虛構的內容。Cloudflare 的說明也提到,LLM 答不出正確答案時可能會編造資訊。它為什麼會這樣、企業怎麼降低,我另外寫在 AI 幻覺是什麼。
精確數字和即時資料要交給系統
庫存剩幾件、這張訂單金額多少、上週不良率多少,這類答案應該由資料庫或試算表算出來,LLM 負責把問題轉成查詢、把結果寫成人看得懂的句子。要精確的部分交給系統,要理解和表達的部分交給 LLM,分工清楚就少很多麻煩。
企業用 LLM 的四種方式
同樣是用 LLM,接法不同,資料的去向、成本和維運負擔差很多。
| 方式 | 適合 | 資料去向 | 要注意 |
|---|---|---|---|
| 商用版聊天產品(ChatGPT Business/Enterprise 等) | 員工日常寫作、摘要、查找 | 依 OpenAI 說明,企業工作區的內容預設不用於訓練 | 個人免費版預設可能用於改善模型,公司資料別放個人帳號 |
| API | 把 LLM 接進自己的系統或流程 | 依 OpenAI 說明,API 資料自 2023 年 3 月起預設不用於訓練;濫用監控紀錄預設最多保留 30 天 | 要有人寫程式、管金鑰、監控用量 |
| 雲端平台(AWS Bedrock、Google Cloud、Microsoft Foundry) | 已經在用某家雲端,想統一帳務與權限 | 依雲端合約與所選區域 | 各平台提供的模型版本與退役時程不同,以平台公告為準 |
| 本地或自架的開放模型(如 Gemma) | 資料不能離開公司環境、用量大且穩定 | 留在自己的機器 | 硬體、更新、效能調校都要自己來 |
幾個補充:
- 員工已經在用免費版,是最常見的風險。OpenAI 的說明是,個人帳號要到「資料控制」裡關掉「為所有人改善模型」,新的對話才不會被拿去訓練。與其禁止,不如提供商用版帳號,並講清楚哪些資料不能貼。商用版怎麼選,可以看企業版 AI 助理怎麼選;員工私下用 AI 的風險與使用規範怎麼訂,見 Shadow AI 是什麼。
- 同一家的模型通常有好幾個入口。例如 Anthropic 的 Claude 除了自家 API,也能透過 AWS Bedrock、Google Cloud、Microsoft Foundry 使用,選哪個入口常取決於公司已經用哪家雲端。
- 開放模型可以放在自己的機器上跑。Google 的 Gemma 是用 Gemini 相同研究技術做出的輕量開放模型,可以在自己的硬體或行動裝置上執行,也能再調整。代價是輕量模型的能力,我會預期比不上同期最大的商用模型,維運也要自己扛。
我的建議順序是:先用商用版聊天產品或 API 把一個流程跑通,確定值得做,再決定要不要換成雲端平台或自架。一開始就自架,常常是花三個月架環境,還沒碰到真正的業務問題。
要不要訓練自己的 LLM
回到開頭老闆的問題。從零訓練一個 LLM,需要大量資料、運算資源和專業團隊,對中小企業幾乎不划算。實際上大家說「訓練我們自己的 AI」時,例如「用我們的產品資料訓練一個客服 AI」,想要的通常是下面其中一件事:
| 你真正想要的 | 做法 | 需要重新訓練模型嗎 |
|---|---|---|
| AI 回答時用上公司的產品、規格、流程 | RAG 或把文件直接放進上下文 | 不用 |
| AI 的回答格式、語氣固定 | 先改提示,不夠再微調 | 微調才需要,而且是在既有模型上調整 |
| AI 能查訂單、建單、更新狀態 | agent+系統串接(如 MCP) | 不用 |
| 資料完全不能出公司 | 自架開放模型,再搭 RAG | 通常不用,直接用現成的開放模型 |
OpenAI 在談提高準確度的指南裡,把「模型缺知識」和「模型行為不對」分成兩條路:缺知識用 RAG 補脈絡,行為不穩才用微調。公司的規格、價格、流程會一直變,用查資料的方式接進來,比訓練進模型好維護。
資料要整理到什麼程度才接得上,可以看企業知識庫要整理到什麼程度,AI agent 才用得上。
導入前先確認的五件事
不管用哪一種方式,第一個專案開始前,我會先把這五件事寫下來:
- 挑一個流程,寫出現在花多少時間。例如「客服回覆規格詢問,每封平均 15 分鐘」。流程怎麼挑,可以看哪些企業流程適合先交給 AI agent。
- 列出會碰到的資料和它們的權限。報價底價、客戶個資、未公開的產品計畫,各自能不能交給哪一種接法。
- 準備 20 到 30 題真實問題當測試題,包括幾題資料裡沒有答案的,看模型會不會老實說不知道。交給模型的指令本身也要寫清楚、測過,做法在提示詞怎麼寫。驗收怎麼設計,可以看 AI agent 專案怎麼驗收。
- 決定哪裡要人確認。對外寄出的信、會改到資料的動作,先設成草稿、等人放行,細節在 AI agent 的權限與人工確認怎麼設。
- 用真實文件估一次 token 用量,乘上預計的每日次數,算出一個月的費用區間。
這五件事寫得出來,要找平台、找供應商或自己做都比較好談;自建、買平台或委外怎麼選,可以看企業 AI agent 自建、平台或委外。
LLM 讀網頁、組答案的方式,也影響你的品牌在 ChatGPT、Google AI 回答裡怎麼被介紹。這一面可以看 AI 怎麼決定推薦哪個品牌。
我們能協助的部分
我們的企業 AI 營運方案從需求診斷開始,工程團隊進駐現場梳理作業細節,再把既有軟體、資料庫與 API 串起來,在真實業務中驗證後上線,之後持續監控與維護。模型可以依任務難度在 OpenAI、Claude、Gemini 之間配置,兼顧反應速度與成本。
資料安全的部分,我們透過企業級 API 串接模型,營運資料預設不用於模型訓練;權限管理與人機審核會一起設計,關鍵環節由真人確認後放行。例如開頭那題「要不要訓練自己的 LLM」,通常在需求診斷階段就能釐清真正要解決的是哪一件事。
常見問題
模型越大,答案就越準嗎?
不一定。InstructGPT 的研究裡,13 億參數、經過指令微調與人類回饋訓練的模型,回答比 1,750 億參數的原始 GPT-3 更受偏好。大模型通常在複雜推理上比較強,但也比較慢、比較貴。簡單的分類、摘要工作用小模型常常就夠,用測試題比較一次最準。
LLM 會記得我上次跟它說過的話嗎?
模型本身不會。每次回答時,它只看得到這次送進上下文裡的內容,包括這段對話先前的訊息。有些聊天產品另外做了記憶功能,把你的偏好存下來、下次自動放進上下文,那是產品層的設計,可以在設定裡查看或關閉。
中文的 token 怎麼估比較準?
用自己的文件實測。各家模型切 token 的方式不同,中文和英文的換算比例也不同,網路上的「幾個字等於一個 token」只能當粗估。把一份典型文件丟進官方的 token 計算工具,得到的數字再乘上每天的使用次數,就是比較可靠的估算基礎。
自架開源模型,資料就一定安全嗎?
資料不會送到外部供應商,這點確實比較單純。但安全還包括誰能存取這台機器、模型輸出有沒有紀錄、權限有沒有跟著原本的系統走。自架省掉的是資料外流到供應商的顧慮,權限和稽核的工作一樣要做。實際在公司電腦上跑模型、要先關掉哪些設定,可以看 Ollama 教學。
公司可以只選一家模型嗎?
可以,而且第一個專案我建議先專心用一家。等流程穩定,再依任務分配:需要深度推理的用能力強的模型,大量、簡單的分類用便宜快速的模型。系統設計時把模型呼叫集中在一處,之後要換或要混用都比較容易。
參考來源
以下依官方文件與原始論文整理,資料政策與模型規格以各家官方頁面當下為準。
- AWS:What is LLM (Large Language Model)?
- Google Cloud:Large language models(LLMs)
- Cloudflare:What is a large language model (LLM)?
- OpenAI Help Center:What are tokens and how to count them?
- Google AI for Developers:Understand and count tokens
- Anthropic:Context windows
- Anthropic:Models overview
- Vaswani et al.(2017):Attention Is All You Need
- Ouyang et al.(2022):Training language models to follow instructions with human feedback
- NIST:AI 600-1 Generative Artificial Intelligence Profile
- OpenAI:Data controls in the OpenAI platform
- OpenAI Help Center:Data Controls FAQ
- OpenAI:Optimizing LLM accuracy
- Google AI for Developers:Gemma models overview