AI Agent 導入

AI agent 一個月的 token 費用怎麼控管?

先看解答

agent 和一般問答最大的差別,是一個任務會連續呼叫模型好幾輪,任務卡住時可能一直重試。控管分三層:程式裡限制每次任務最多跑幾步;API 平台設月預算,OpenAI 可在組織或專案設硬上限,到了就回 429 錯誤,Anthropic 可在帳單頁設低於等級上限的支出上限;最後讓簡單步驟用便宜的小模型,只有需要判斷的步驟用大模型。

三層各自擋什麼

層級做法擋住的狀況
單次任務限制最多幾輪,例如 OpenAI Agents SDK 的 max_turns,超過就丟出 MaxTurnsExceeded任務卡在迴圈裡一直重試
整個帳戶OpenAI 的組織或專案硬上限、Anthropic 自訂支出上限;另設提醒門檻某個月用量暴增,月底才發現
模型分配分類、摘要用小模型,需要判斷的步驟才用大模型;不急的批次工作改用 Batch API每一步都用最貴的模型

舉個例子。一個查訂單、擬回信的 agent,正常要 4 輪:讀信、查訂單、查出貨、擬稿。設定最多 8 輪,就算 ERP 一直逾時,這封信最多也只花兩倍的費用,接著轉給人處理。

提醒和硬上限要分開設。OpenAI 的提醒只會通知、流量照跑;硬上限一到,請求就會被擋下。正式上線的服務,我建議提醒設在預算的 50% 和 80%,硬上限留一點緩衝,避免客服在月底突然停擺。

由誰負責監看費用、超支時誰決定要不要加預算,屬於導入前就該談好的維運分工,可以一起放進 AI agent 自建或委外 的評估。

參考來源

  1. OpenAI Agents SDK:Running agents(max_turns)(另開分頁)
  2. OpenAI:Spend limits(另開分頁)
  3. Anthropic:Rate limits(Spend limits)(另開分頁)
  4. OpenAI:API Pricing(另開分頁)
回到AI Agent 導入