LLM 是什麼?大型語言模型的原理、限制與企業用法

ChatGPT、Claude、Gemini 背後都是大型語言模型。這篇從 token 和預測下一個字講起,說明它容易出錯的地方,以及企業用聊天產品、API、雲端平台或本地模型的差別。

先說結論

LLM(大型語言模型)是用大量文字訓練、靠預測下一個 token 產生文字的模型,ChatGPT、Claude、Gemini 背後都是它。它擅長讀、寫、摘要與改寫,但知識停在訓練資料的截止日,也會講錯。企業很少需要自己訓練模型:先用商用版聊天產品或 API 試一個流程,要查公司資料再加 RAG,要進系統做事才接 agent。

木桌上的黃銅排字盤排著一列空白鉛字,一支鑷子夾著下一顆鉛字停在末端上方,後方是裝滿鉛字的木製字盒抽屜
LLM 是什麼?大型語言模型的原理、限制與企業用法 封面視覺

會議上老闆問:「我們是不是也該訓練一個自己的 LLM?」IT 同事想了一下,說要先查查看。散會後大家各自去搜尋,看到的是 GPT、Gemini、生成式 AI、RAG、agent 一整串名詞,越看越不確定這題該從哪裡回答。

這題我的答案通常是:先不用。可是要講清楚為什麼不用,得先知道 LLM 到底是什麼、它怎麼產生答案、會在哪裡出錯。弄懂這幾件事,後面要不要加 RAG、要不要做 agent、資料能不能放進去,才判斷得下去。

LLM 是什麼:用大量文字訓練出來的語言模型

LLM 是 Large Language Model 的縮寫,中文叫「大型語言模型」。AWS 的定義是:以大量資料預先訓練、非常大型的深度學習模型。Google Cloud 的說法更直接:一種用大量資料訓練的統計語言模型,可以生成、翻譯文字,處理各種自然語言工作。

「大型」指兩件事。一是訓練資料多,AWS 舉的例子是 Common Crawl 這類網頁資料集,收錄的網頁超過 500 億頁;二是模型本身的參數多,GPT-3 有 1,750 億個參數。參數可以想成模型內部上千億個可調整的旋鈕,訓練的過程就是把這些旋鈕一點一點調到位。

Cloudflare 把 LLM 放在機器學習、深度學習和生成式 AI 的交會處:它用深度學習的方法訓練,產出的是新生成的文字,所以屬於生成式 AI 的一種。你每天打開的 ChatGPT、Claude、Gemini,都是建在 LLM 上面的產品。

LLM 怎麼運作:把文字切成 token,一次預測一個

LLM 產生回答的方式,比多數人想像的單純:它看著目前為止的文字,猜下一小段最可能是什麼,接上去,再猜下一段,一路接到回答結束。

先把文字切成 token

模型讀的是 token。OpenAI 的說明是,一個 token 可能是一個字元、半個單字、一整個單字或一個標點。英文大約 4 個字元一個 token,約等於四分之三個單字;Google 的 Gemini 文件也寫 100 個 token 大約是 60 到 80 個英文字。

中文的換算比例和英文不同,OpenAI 也提醒每種語言的字數和 token 關係不一樣。token 和兩件事直接相關:

  • 費用:API 通常按輸入與輸出的 token 數計價,輸出往往比輸入貴。
  • 上限:每個模型一次能處理的 token 數有上限,稱為上下文長度(context window)。

所以要估成本,我建議拿一份你們真正會丟進去的文件,例如一張報價單加上規格表,用官方的 token 計算工具實際算一次,比套用英文的換算公式可靠。

一次預測一個 token

AWS 描述訓練過程時寫得很清楚:模型反覆調整參數,直到它能根據前面的 token 正確預測下一個 token。這就是 LLM 的核心能力。

讓它能看懂一長段文字的,是 2017 年 Google 研究團隊在論文〈Attention Is All You Need〉提出的 Transformer 架構。它用一種叫自注意力(self-attention)的機制,讓模型在處理每個字時,同時看整段文字裡其他字跟它的關係。「這個價格含稅嗎」裡的「這個」指哪一個價格,靠的就是這種關聯。

NIST 在生成式 AI 風險框架裡點出這套做法的另一面:模型產出的是近似訓練資料統計分布的內容,所以同一種機制可以生出正確的句子,也可以生出流暢但錯誤的句子。LLM 產生的是「最可能接下去的文字」,事實正確與否要另外把關。

預訓練之後,還要教它聽指令

只會預測下一個 token 的模型,你問它「幫我寫一封延遲出貨的道歉信」,它可能接著寫出另一個問題,因為網路上的文字常常是這樣接的。要變成能對話、能照指示做事的助手,還要再訓練幾輪。

OpenAI 2022 年的 InstructGPT 論文是這一步的代表做法:

階段在做什麼效果
預訓練用大量文字學會預測下一個 token學會語言、常識和大量知識
指令微調用人寫的「指令+理想回答」範例再訓練學會照指令回答
人類回饋強化學習(RLHF)請人替多個回答排序,讓模型往較好的方向調整回答更有幫助,較少捏造與有害內容

論文裡有個結果很有意思:經過這兩步調整、只有 13 億參數的模型,回答比 1,750 億參數、未經調整的 GPT-3 更受評分者偏好。模型好不好用,參數大小只是其中一個條件。

書桌上由左到右:用麻繩綑起的一大疊舊書與紙張、一本貼滿索引標籤的筆記本、一張壓著黃銅紙鎮、角落有鉛筆勾號的空白卡片

LLM、生成式 AI、ChatGPT 和 AI agent 的關係

這幾個名詞常被混在一起講,其實是不同層次的東西:

名詞是什麼例子
生成式 AI能產生新內容的 AI 總稱,包含文字、圖片、聲音寫文案、生成圖片、合成語音
LLM生成式 AI 裡專門處理文字的模型GPT、Claude、Gemini、Gemma
聊天產品把 LLM 包成介面給人直接用ChatGPT、Claude、Gemini App
RAG回答前先查你的文件,讓 LLM 依資料作答內部知識庫問答
AI agent由 LLM 決定下一步、呼叫工具完成多步驟工作查訂單、草擬回覆、等人確認後寄出

LLM 是引擎,其他都是用這顆引擎組出來的東西。例如要讓它查公司文件,做法是 RAG;要讓它連上 ERP、CRM 這些系統,常見的標準是 MCP。

要讓它自己決定下一步、完成一整段工作,就是 agent,和聊天機器人、RPA 的差別可以看 AI agent 和聊天機器人、RPA、自動化流程差在哪。

LLM 擅長什麼,會在哪裡出錯

LLM 最擅長處理「文字進、文字出」的工作,例如摘要一封長信、把會議紀錄整理成待辦、改寫成不同語氣、從一段描述抽出品名和數量、把技術文件翻成業務看得懂的說法。這些工作過去要一個人花半小時,現在幾秒鐘就有草稿。

限制也很具體,我把企業最常踩到的四個列出來:

知識停在訓練資料的截止日

模型只知道訓練資料裡有的東西。Anthropic 的模型總覽表會同時列出兩個日期:「可靠知識截止」是模型知識最完整可靠的時間點,「訓練資料截止」是訓練資料涵蓋的較大範圍。問它上個月的新法規、你們這季的新產品,它不知道,還可能用舊資訊回答。

上下文有上限,塞越多不一定越好

Anthropic 把上下文長度形容為模型的「工作記憶」,和訓練資料是兩回事:你在對話裡貼的文件、先前的對話、模型的回答,全都算在這個額度裡。它也提醒,token 越多,模型找回與記住細節的準確度會下降。挑對要放進去的內容,比放得越多越好。agent 每一步該放哪些資料,在 Context Engineering 是什麼 有完整做法。

會流暢地講錯

NIST 把這種現象稱為 confabulation,一般說的「AI 幻覺」:自信地產出錯誤或虛構的內容。Cloudflare 的說明也提到,LLM 答不出正確答案時可能會編造資訊。它為什麼會這樣、企業怎麼降低,我另外寫在 AI 幻覺是什麼。

精確數字和即時資料要交給系統

庫存剩幾件、這張訂單金額多少、上週不良率多少,這類答案應該由資料庫或試算表算出來,LLM 負責把問題轉成查詢、把結果寫成人看得懂的句子。要精確的部分交給系統,要理解和表達的部分交給 LLM,分工清楚就少很多麻煩。

企業用 LLM 的四種方式

同樣是用 LLM,接法不同,資料的去向、成本和維運負擔差很多。

方式適合資料去向要注意
商用版聊天產品(ChatGPT Business/Enterprise 等)員工日常寫作、摘要、查找依 OpenAI 說明,企業工作區的內容預設不用於訓練個人免費版預設可能用於改善模型,公司資料別放個人帳號
API把 LLM 接進自己的系統或流程依 OpenAI 說明,API 資料自 2023 年 3 月起預設不用於訓練;濫用監控紀錄預設最多保留 30 天要有人寫程式、管金鑰、監控用量
雲端平台(AWS Bedrock、Google Cloud、Microsoft Foundry)已經在用某家雲端,想統一帳務與權限依雲端合約與所選區域各平台提供的模型版本與退役時程不同,以平台公告為準
本地或自架的開放模型(如 Gemma)資料不能離開公司環境、用量大且穩定留在自己的機器硬體、更新、效能調校都要自己來

幾個補充:

  • 員工已經在用免費版,是最常見的風險。OpenAI 的說明是,個人帳號要到「資料控制」裡關掉「為所有人改善模型」,新的對話才不會被拿去訓練。與其禁止,不如提供商用版帳號,並講清楚哪些資料不能貼。商用版怎麼選,可以看企業版 AI 助理怎麼選;員工私下用 AI 的風險與使用規範怎麼訂,見 Shadow AI 是什麼。
  • 同一家的模型通常有好幾個入口。例如 Anthropic 的 Claude 除了自家 API,也能透過 AWS Bedrock、Google Cloud、Microsoft Foundry 使用,選哪個入口常取決於公司已經用哪家雲端。
  • 開放模型可以放在自己的機器上跑。Google 的 Gemma 是用 Gemini 相同研究技術做出的輕量開放模型,可以在自己的硬體或行動裝置上執行,也能再調整。代價是輕量模型的能力,我會預期比不上同期最大的商用模型,維運也要自己扛。

我的建議順序是:先用商用版聊天產品或 API 把一個流程跑通,確定值得做,再決定要不要換成雲端平台或自架。一開始就自架,常常是花三個月架環境,還沒碰到真正的業務問題。

要不要訓練自己的 LLM

回到開頭老闆的問題。從零訓練一個 LLM,需要大量資料、運算資源和專業團隊,對中小企業幾乎不划算。實際上大家說「訓練我們自己的 AI」時,例如「用我們的產品資料訓練一個客服 AI」,想要的通常是下面其中一件事:

你真正想要的做法需要重新訓練模型嗎
AI 回答時用上公司的產品、規格、流程RAG 或把文件直接放進上下文不用
AI 的回答格式、語氣固定先改提示,不夠再微調微調才需要,而且是在既有模型上調整
AI 能查訂單、建單、更新狀態agent+系統串接(如 MCP)不用
資料完全不能出公司自架開放模型,再搭 RAG通常不用,直接用現成的開放模型

OpenAI 在談提高準確度的指南裡,把「模型缺知識」和「模型行為不對」分成兩條路:缺知識用 RAG 補脈絡,行為不穩才用微調。公司的規格、價格、流程會一直變,用查資料的方式接進來,比訓練進模型好維護。

資料要整理到什麼程度才接得上,可以看企業知識庫要整理到什麼程度,AI agent 才用得上。

導入前先確認的五件事

不管用哪一種方式,第一個專案開始前,我會先把這五件事寫下來:

  1. 挑一個流程,寫出現在花多少時間。例如「客服回覆規格詢問,每封平均 15 分鐘」。流程怎麼挑,可以看哪些企業流程適合先交給 AI agent。
  2. 列出會碰到的資料和它們的權限。報價底價、客戶個資、未公開的產品計畫,各自能不能交給哪一種接法。
  3. 準備 20 到 30 題真實問題當測試題,包括幾題資料裡沒有答案的,看模型會不會老實說不知道。交給模型的指令本身也要寫清楚、測過,做法在提示詞怎麼寫。驗收怎麼設計,可以看 AI agent 專案怎麼驗收。
  4. 決定哪裡要人確認。對外寄出的信、會改到資料的動作,先設成草稿、等人放行,細節在 AI agent 的權限與人工確認怎麼設。
  5. 用真實文件估一次 token 用量,乘上預計的每日次數,算出一個月的費用區間。

這五件事寫得出來,要找平台、找供應商或自己做都比較好談;自建、買平台或委外怎麼選,可以看企業 AI agent 自建、平台或委外。

LLM 讀網頁、組答案的方式,也影響你的品牌在 ChatGPT、Google AI 回答裡怎麼被介紹。這一面可以看 AI 怎麼決定推薦哪個品牌。

我們能協助的部分

我們的企業 AI 營運方案從需求診斷開始,工程團隊進駐現場梳理作業細節,再把既有軟體、資料庫與 API 串起來,在真實業務中驗證後上線,之後持續監控與維護。模型可以依任務難度在 OpenAI、Claude、Gemini 之間配置,兼顧反應速度與成本。

資料安全的部分,我們透過企業級 API 串接模型,營運資料預設不用於模型訓練;權限管理與人機審核會一起設計,關鍵環節由真人確認後放行。例如開頭那題「要不要訓練自己的 LLM」,通常在需求診斷階段就能釐清真正要解決的是哪一件事。

常見問題

模型越大,答案就越準嗎?

不一定。InstructGPT 的研究裡,13 億參數、經過指令微調與人類回饋訓練的模型,回答比 1,750 億參數的原始 GPT-3 更受偏好。大模型通常在複雜推理上比較強,但也比較慢、比較貴。簡單的分類、摘要工作用小模型常常就夠,用測試題比較一次最準。

LLM 會記得我上次跟它說過的話嗎?

模型本身不會。每次回答時,它只看得到這次送進上下文裡的內容,包括這段對話先前的訊息。有些聊天產品另外做了記憶功能,把你的偏好存下來、下次自動放進上下文,那是產品層的設計,可以在設定裡查看或關閉。

中文的 token 怎麼估比較準?

用自己的文件實測。各家模型切 token 的方式不同,中文和英文的換算比例也不同,網路上的「幾個字等於一個 token」只能當粗估。把一份典型文件丟進官方的 token 計算工具,得到的數字再乘上每天的使用次數,就是比較可靠的估算基礎。

自架開源模型,資料就一定安全嗎?

資料不會送到外部供應商,這點確實比較單純。但安全還包括誰能存取這台機器、模型輸出有沒有紀錄、權限有沒有跟著原本的系統走。自架省掉的是資料外流到供應商的顧慮,權限和稽核的工作一樣要做。實際在公司電腦上跑模型、要先關掉哪些設定,可以看 Ollama 教學。

公司可以只選一家模型嗎?

可以,而且第一個專案我建議先專心用一家。等流程穩定,再依任務分配:需要深度推理的用能力強的模型,大量、簡單的分類用便宜快速的模型。系統設計時把模型呼叫集中在一處,之後要換或要混用都比較容易。

參考來源

以下依官方文件與原始論文整理,資料政策與模型規格以各家官方頁面當下為準。

從這篇繼續看相關內容

依文章主題整理同站文章、服務/產品與 FAQ 入口,讓下一步有清楚的閱讀方向。

延伸閱讀

下一步

服務入口

了解企業 AI 營運導入

名詞弄清楚之後,看 AI agent 怎麼接進既有系統,以及哪些動作要人工確認。

查看相關頁面

常見問題

AI 的 token 是什麼?

用量和費用怎麼算,先看一題直接回答。

查看 FAQ 解答

企業 AI 落地實踐

把文章裡的判斷帶回你的流程

從一個實際工作流開始,與 EthorX 共同釐清 AI agents 的導入起點。