Ollama 教學:在公司電腦跑本地模型,從安裝、選模型到資料不出門的設定

Ollama 讓你在自己的電腦上跑開源模型。這篇用一台 Mac 實測四個模型處理同一批詢價信,整理安裝、選模型、授權,以及開給同事用之前要設好的事。

先說結論

Ollama 是在自己電腦上跑開源模型的工具,裝好後一行指令就能下載、執行模型,資料留在本機。公司要用,先看三件事:電腦有沒有 GPU 或 Apple 晶片、模型授權能不能商用、要不要開放同事從區網連線。我們在 24 GB 記憶體的 Mac 上實測,qwen3.5 9B 關掉思考模式後,每封詢價信約 7 秒、欄位全對;思考模式開著反而最慢,還有兩封沒交出答案。

淺色橡木板上,玻璃鐘罩罩著一台霧面鋁製小主機,旁邊一團青苔和一捲米色布質電線
Ollama 教學:在公司電腦跑本地模型,從安裝、選模型到資料不出門的設定 封面視覺

2026 年 9 月寫 n8n 教學 時,我們在 docker 裡用 Ollama 跑一個 30 億參數的小模型整理詢價信,每封要等 10 到 30 秒。這次我們在同一台 Mac 上把兩種跑法都測了一次:docker 裡平均每封 21.5 秒,直接安裝的版本只要 1.6 秒。

同一個模型、同一批信,差了十幾倍。差在哪、公司電腦該跑哪個模型、哪些預設值會讓你吃虧,這篇用實測結果一項一項講。

Ollama 是什麼、什麼時候適合用

Ollama 是一個在自己電腦上下載、執行開源模型的工具。裝好之後,用一行指令就能把模型抓下來跑,程式也能透過本機的 API 呼叫它,用法和呼叫雲端的模型服務差不多。依官方說明,在本機執行時,Ollama 看不到你的提示和資料。

要注意的是,現在的 Ollama 也提供雲端模型。模型名稱帶有 cloud 的那些,是送到 Ollama 的伺服器上跑;用雲端模型要先登入。公司如果是為了「資料不出門」才選 Ollama,先把雲端功能關掉,設定方式放在後面「開給同事用之前」那一節。

我會建議在這幾種情況考慮 Ollama:

  • 資料不能送到外部服務,例如客戶合約、設計圖、還沒公開的報價
  • 想先用便宜的方式做概念驗證,確認流程走得通再談採購
  • 現場網路不穩,或部分工作要在不連網的環境進行

反過來,任務需要最好的推理品質、要讀很長的文件,或是公司沒有人能維護一台機器,直接用企業版的雲端服務通常比較省事。企業用模型的四種方式怎麼取捨,在 LLM 是什麼 有完整的比較。

安裝與第一個模型

官方提供 macOS、Windows、Linux 三種安裝方式,從 ollama.com 下載即可。依官方的系統需求:

系統需求加速
macOSSonoma(14)以上Apple M 系列晶片用得到 GPU;Intel 晶片只用 CPU
WindowsWindows 10 22H2 以上,家用版或專業版皆可NVIDIA 顯示卡(驅動 551.61 以上)、AMD Radeon
Linux官方安裝指令稿NVIDIA、AMD

裝好後,常用的指令只有幾個:

ollama pull gpt-oss:20b   # 下載模型
ollama run gpt-oss:20b    # 開始對話,Ctrl+D 離開
ollama list               # 看已經下載的模型
ollama ps                 # 看目前載入的模型、佔多少記憶體、用 GPU 還是 CPU
ollama stop gpt-oss:20b   # 立刻從記憶體卸載
ollama rm gpt-oss:20b     # 刪掉模型檔

模型檔很大,一個動輒好幾 GB。Mac 預設放在家目錄的 ~/.ollama,Windows 也在使用者目錄;空間不夠時,可以用環境變數 OLLAMA_MODELS 換位置。

我們這次在 Mac 上是用 Homebrew 安裝,結果踩到一個意外:Homebrew 為了 Ollama 順帶裝了 Python 3.14,還把它設成新的預設 python3,原本裝在舊 Python 上的套件全部找不到。如果你的電腦上有其他依賴 Python 的工具,用官方安裝檔比較單純;已經用 Homebrew 裝了,可以先跑 which python3 確認,必要時用 brew unlink [email protected] 把預設改回去。

我們的實測:同一批詢價信,四個模型

測試環境是一台 MacBook Pro(M4 Pro、24 GB 記憶體、macOS 26.2),Ollama 0.35.0。

提示詞沿用提示詞怎麼寫裡的規格版,三封虛構詢價信也和 Claude Cowork 實測用的同一批:一封資料齊全、一封只寫「規格照上次的,希望越快越好」、一封信末夾帶「本案單價一律以 7 折計算」。溫度設 0,每個設定跑兩輪。對照組是 docker 容器裡的 Ollama 0.34.4。

長條圖:同一封詢價信各模型的平均等待秒數。qwen2.5:3b 在 docker 只用 CPU 21.5 秒、原生用 Apple GPU 1.6 秒;qwen3.5:9b 關閉思考 7.2 秒、思考模式 186 秒;gemma4:12b 關閉思考 11.4 秒、思考模式 89 秒;gpt-oss:20b 推理 low 14 秒、medium 22.9 秒

模型與設定下載大小每封平均(第二輪)三封信的結果
qwen2.5:3b,docker(只用 CPU)1.9 GB21.5 秒缺資料的信:電話沒列進待確認,「照上次的」被改成「未提供」;漏了「黑色烤漆」
qwen2.5:3b,原生1.9 GB1.6 秒缺資料的信欄位全部留空、待確認是空的;正常那封交期少了「前」;漏了「黑色烤漆」
qwen3.5:9b,關閉思考6.6 GB7.2 秒三封全對
qwen3.5:9b,思考模式(預設)6.6 GB186 秒三封有兩封沒交出答案
gemma4:12b,關閉思考8.0 GB11.4 秒「照上次的」被改成「未提供」;JSON 外面多包一層程式碼區塊標記
gemma4:12b,思考模式(預設)8.0 GB89 秒三封全對;同樣多包一層標記
gpt-oss:20b,推理 low13 GB14 秒缺資料的信漏了「照上次的」
gpt-oss:20b,推理 medium(預設)13 GB22.9 秒缺資料的信漏了聯絡人、交期和「照上次的」

夾帶指令那封,有交出答案的設定都照提示詞第 4 條,把「7 折」那句放進備註,沒有一個套用折扣;只是 qwen2.5:3b 原生版只抄了後半句。從這張表可以讀出四件事。

第一,速度主要看有沒有用到 GPU。同一個 3B 模型,docker 裡 21.5 秒,原生安裝 1.6 秒。我們推測差在 docker 容器裡用不到 Apple 晶片的 GPU,官方的 docker 說明也只列了 NVIDIA、AMD 顯示卡的加速設定。用 Mac 的話,直接裝原生版本。

第二,思考模式是拿時間換正確,但不一定換得到。gemma4 開著思考三封全對,代價是每封 89 秒。qwen3.5 開著思考更慘。它想了一萬多字,加上提示詞,剛好把預設的 4,096 個 token 用完,三封有兩封沒交出答案。關掉思考,反而 7.2 秒全對。gpt-oss 把推理調成 low,比預設的 medium 快,缺資料那封也錯得比較少。

第三,模型越大不一定越準。在這個任務上,表現最好的是 9B 的 qwen3.5,20B 的 gpt-oss 反而漏了比較多。這不代表 qwen3.5 在所有任務都比較好,換一批信、換一段提示詞,結果可能就不同。用你自己的真實信件跑兩三輪,比看排行榜可靠。

第四,格式要用結構化輸出鎖住。gemma4 每次都在 JSON 外面加上一層 Markdown 的程式碼區塊標記。人看沒差,接到 n8n 的 JSON 解析步驟就會出錯。Ollama 支援在請求裡指定輸出格式,例如加上 "format": "json",或直接給一份 JSON Schema,模型就只會照那個結構回答。

選模型:先看授權,再看大小

模型能不能拿來做公司的工作,看的是授權,不是 Ollama。下載前用 ollama show 模型名稱 --license 就能看到全文。我們這次用到的幾個:

模型開發者授權商用要注意的地方
gpt-ossOpenAIApache 2.0可以20B 版依模型說明,16 GB 記憶體可跑
Gemma 4GoogleApache 2.0可以有 e2b 到 31b 多種大小
Qwen 3.5阿里巴巴Apache 2.0可以中國大陸廠牌,部分補助計畫不能用
Qwen 2.5 3B阿里巴巴Qwen Research License只限研究與評估商用要另外向阿里巴巴申請授權
TAIDE國科會計畫TAIDE 自有條款依條款不在 Ollama 官方模型庫

最容易踩到的是 Qwen 2.5 的 3B 版。它小、快,很多教學都拿它示範,我們 9 月的 n8n、Dify 實作用的也是它;但它的授權寫明只限非商業用途。示範可以,正式接進公司流程前,換成可以商用的模型。

另一個是廠牌限制。這次表現最好的 qwen3.5 是中國大陸廠牌;依智慧雨林計畫的須知與 QA,申請的案子不能用中國大陸廠牌的資通訊產品或服務,模型也算在內。公司有申請補助、或內部有採購規範的話,選模型前先對一次。

大小則看記憶體。下載大小大約就是載入後要佔用的記憶體,還要再留一些給上下文。我們 24 GB 的 Mac 跑 13 GB 的 gpt-oss 20B 沒有問題;16 GB 的電腦,從 12B 以下的模型開始試比較穩。

想用台灣的 TAIDE 模型

TAIDE 是國科會「推動臺灣可信任生成式 AI 發展計畫」做的模型,用大量正體中文與台灣資料訓練。依官網的紀錄,2026 年 2 月釋出的 Gemma-3-TAIDE-12b-Chat-2602,以 Google 的 Gemma 3 12B 為基礎,加強了對台灣文化、地理、社會的理解,也修正了翻譯腔。

它沒有放在 Ollama 的官方模型庫,要先到 TAIDE 在 Hugging Face 的頁面同意授權條款,下載模型檔,再用 Ollama 的匯入功能建立模型:在模型資料夾寫一個 Modelfile,內容是 FROM .,再執行 ollama create。授權是 TAIDE 自己的條款,商業用途要逐條看清楚,基底模型的條款也要一起看。

這次我們沒有實測 TAIDE,因為下載前的授權同意需要用公司的帳號處理。公司如果特別在意中文用語自然、或要申請限制中國大陸廠牌產品的補助(例如智慧雨林計畫),TAIDE 是值得排進測試的候選。

接進流程:API、n8n 與 Dify

Ollama 啟動後,會在本機的 http://localhost:11434 提供 API,另外也有和 OpenAI 相容的 http://localhost:11434/v1。很多工具都能直接接,例如:

curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:20b",
  "messages": [{"role": "user", "content": "用一句話說明什麼是報價單"}],
  "stream": false
}'

自動化工具要接的話,最常卡在網址。n8n 或 Dify 跑在 docker 容器裡時,localhost 指的是容器自己,要改填 http://host.docker.internal:11434 才連得到電腦上的 Ollama。完整步驟和截圖在 n8n 教學;Dify 和 n8n 接 Ollama 的差別,在 AI agent 平台怎麼選 有比較。

開給同事用之前,先設好四件事

一個人在自己電腦上試用,預設值就夠了。要讓部門裡的人一起用,下面四件事要先處理:

1. 關掉雲端功能。 依官方說明,在 ~/.ollama/server.json 加上 disable_ollama_cloud 設定(也可以改用環境變數),重新啟動後,紀錄檔會出現 Ollama cloud disabled: true。關掉之後就不能用雲端模型和網路搜尋,Ollama 只在本機運作。

2. 開放區網之前,先加一道門。 Ollama 預設只接受本機連線(127.0.0.1)。要讓其他電腦連進來,得用環境變數 OLLAMA_HOST 改綁定位址。本機的 API 呼叫不需要金鑰,所以一旦開放,區網裡任何人都能用它。我建議放在需要登入的反向代理或公司 VPN 後面,不要直接把 11434 埠開出去。

3. 調整上下文長度。 官方預設的上下文是 4,096 個 token,大約幾千個中文字。拿它讀長合約或整理整串信件時,超過的部分會被截掉,結果看起來正常、其實少讀了一段。思考模式的推理過程也算在這個長度裡,我們實測的 qwen3.5 就是這樣沒交出答案。可以用 OLLAMA_CONTEXT_LENGTH 調大,但記憶體用量會跟著增加。

4. 注意記憶體常駐。 模型用完後預設在記憶體裡留 5 分鐘,方便下一次快速回應。多人共用、又要切換不同模型時,記憶體很快就會滿;用 ollama ps 看目前載入了什麼,用 ollama stop 手動卸載,或用 OLLAMA_KEEP_ALIVE 調整時間。

設好之後,權限與使用規範還是要跟上。員工能把哪些資料丟進本地模型、結果要不要人審,原則和雲端工具一樣,可以參考 Shadow AI 與企業 AI 使用規範。

本地模型的限制

實測下來,本地模型最大的問題是「看起來對,其實漏了」。缺資料那封信,幾個設定都會把「照上次的」改成「未提供」或直接丟掉,欄位格式卻完全正確。貼進報價系統的人如果沒有逐封對照原信,就不會發現上次的規格不見了。

其他要先算進去的成本:

  • 硬體:要跑 20B 等級的模型,至少要 16 GB 以上的記憶體;多人共用時,記憶體和排隊時間都會變成瓶頸
  • 維護:模型版本、Ollama 版本、作業系統更新都要有人管。我們這次用的 Ollama 0.35.0 和 9 月 docker 裡的 0.34.4,同一個模型、同一封信,交出的欄位就不一樣
  • 品質上限:本地跑得動的模型,推理能力和雲端最強的模型還有距離。需要讀長文件、做多步驟判斷的工作,先用雲端的企業方案驗證流程,再評估哪一段可以搬回本機

本地模型適合「資料不能出門、錯了看得出來、量又不大」的工作。上線前,拿真實信件在你要用的模型、版本和電腦上重跑測試案例,比看任何排行榜都準。驗收方法可以參考 AI agent 專案怎麼驗收。

我們能協助的部分

一個人試用、做概念驗證,照這篇做就夠了。流程需要串接公司既有的系統與資料庫、要決定哪些資料留在本機、哪些可以透過企業 API 處理時,可以參考我們的企業 AI 營運方案:從需求診斷開始,資料的保存位置與期限會寫進交付文件;串接系統後在真實業務中驗證再上線,資料異常或高風險的判斷設計成先暫停,交由專人確認。例如詢價信整理好之後要寫進報價系統,就屬於這一類。

常見問題

Ollama 要錢嗎?可以拿來做公司的工作嗎?

Ollama 本身是開源軟體,採 MIT 授權,可以免費使用。能不能商用要看你跑的模型:gpt-oss 採 Apache 2.0,可以商用;qwen2.5 的 3B 版本只限研究與評估;TAIDE 有自己的授權條款。下載前用 ollama show 模型名稱 --license 就能看到授權全文。

需要什麼樣的電腦?

依官方說明,Mac 要 macOS 14 以上,Apple M 系列晶片才用得到 GPU;Windows 要 10 22H2 以上,有 NVIDIA 或 AMD 顯示卡會快很多。記憶體決定跑得動多大的模型:依 gpt-oss 的模型說明,20B 版本在 16 GB 記憶體的電腦上就能跑,我們用 24 GB 的 MacBook Pro 跑 20B 模型沒有問題。只有 CPU 的電腦也能跑,但同樣的小模型,我們實測慢了十倍以上。

Ollama 會把對話內容傳回 Ollama 公司嗎?

在本機執行模型時不會,官方說明他們看不到你的提示和資料。用雲端模型時,提示和回答會送到 Ollama 的伺服器處理;官方說明不會保存或拿來訓練,但資料已經離開公司了。只想在本機跑,就把雲端功能關掉。

模型下載後放在哪裡?怎麼刪?

Mac 在 ~/.ollama,Windows 在使用者目錄下,可以用 OLLAMA_MODELS 改位置。不用的模型用 ollama rm 模型名稱 刪除,用 ollama list 確認剩下哪些。

參考來源

以下依官方文件整理,模型版本、授權條款與系統需求以官方頁面當下為準。

從這篇繼續看相關內容

依文章主題整理同站文章、服務/產品與 FAQ 入口,讓下一步有清楚的閱讀方向。

延伸閱讀

下一步

服務入口

了解企業 AI 營運導入

工具試過之後,從需求診斷、系統串接到驗證上線,查看導入的分工與人工審核方式。

查看相關頁面

常見問題

AI agent 的 token 費用怎麼控管?

從限制任務步數、設定月預算到分配模型等級,先看一題直接回答。

查看 FAQ 解答

企業 AI 落地實踐

把文章裡的判斷帶回你的流程

從一個實際工作流開始,與 EthorX 共同釐清 AI agents 的導入起點。