Agentic AI 成本管理
這篇文章的核心不是「模型便宜不便宜」,而是 agent 完成一個任務到底要花多少成本。作者把成本拆成推理、上下文、檢索、協作與治理幾層,並主張要用 task-level 指標看 AI,而不是只看 token 單價。
主要成本層
- LLM inference / re-sent context:同一個 agent workflow 反覆重送 system prompt、tool schema、skills 與狀態,讓大量 token 花在「重讀已知資訊」
- Context management / context rot:上下文變長後,品質會下降,導致更多 retry
- Retrieval / RAG stack:embedding、vector DB、re-indexing、資料清理都會吃成本
- Orchestration / tooling / governance:planning、validation、monitoring、human-in-the-loop、audit logs 其實常常是總成本的大宗
Context window 與硬體供給
SemiAnalysis 這篇提醒一件很現實的事:context window 不會無限長,因為瓶頸不只在模型架構,也在 HBM / DRAM 供給。KV cache 隨 context 長度線性成長,推論端把更多 token 塞進去,就等於把更多記憶體成本和頻寬壓力推回基礎設施層;這也是為什麼 context-engineering 不是風格問題,而是成本問題。
更實際的做法仍然是舊套路:prompt caching、compaction、sub-agent isolation、JIT retrieval。硬體短期不會幫你把 1M 變成 100M,所以能省下的 token、能隔離的 context、能減少的 retries,還是最直接的成本控制點。
BusinessNext 對 HBF 的更新提供另一個成本層:若 HBF 成為 HBM 與 SSD 之間的近端容量層,模型權重、常用知識或 KV 相關資料可以有更細的 memory placement,但較慢的延遲與資料搬移也會成為新成本。評估 ai-memory-hierarchy 時,應量測 cache hit/miss、首 token 延遲、decode throughput、搬移頻寬、GPU 利用率、任務完成率與總成本;「容量更大」不等於 agent 更快,也不等於可以省略 context-engineering。
最有效的控成本手段
- Prompt caching:把靜態 prefix 固定下來,讓重複上下文命中快取
- Compaction:長對話摘要後重新啟動,減少 context 失真
- Just-in-time retrieval:不要把所有資料先塞進 context
- Sub-agent isolation:把高噪音工作拆成多個子代理,降低單一 context 的污染
- 降低 retries:資料庫一致性、延遲與觀測性要一起處理,否則 retry 會把成本放大
- Copilot-scale prompt caching:GitHub Copilot 把快取命中率儀表化,因為 1% 的命中率差異在每天數十億次呼叫下會放大成真金白銀
- Advisor / critic routing:不是每次都叫大模型;先讓較便宜的模型執行,卡關時再把大模型當顧問或批評者接入
- 中階 agentic 模型重估:Claude Sonnet 5 這類模型若以較低單價接近旗艦模型在 coding / terminal benchmark 的表現,先用 model-harness-fit 驗證既有 harness 是否可降級到較便宜模型,不要預設每個任務都用最大模型
配額控制:把額度當成可延後使用的工作資源
BusinessNext 整理 OpenAI 對 Codex 與 ChatGPT Work 用戶發放一次 banked reset 的案例:使用者可把重置保留到接近週配額上限、但確實需要跑大型任務時再套用,入口也從桌面 App 擴到 web 與 mobile。這不是單純增加免費額度,而是把使用者的有限容量變成可延後配置的 budget control;對 agent workflow 來說,應把高價值、長時間任務留給可預期的配額,而不是讓背景 retry 或低價值探索先耗盡上限。
這個案例也提醒成本控制是分散式狀態問題:OpenAI 曾因約兩小時內部分重置未成功,向受影響的約 50 萬名用戶補發額度,並把補發流程當成全體發放前的基礎架構驗證。設計類似 quota/reset 機制時,至少要記錄可用額度、套用時間、失敗重試、補償與到期日;實際期限與資格仍應以產品帳號和官方文件為準,不能把單一媒體報導的用戶數或配額政策當成長期穩定的成本基準。
Enterprise cost leverage:先看流程價值,再看 token
BusinessNext 對 C.H. Robinson 的案例提供一個 enterprise-scale 的對照:公司表示報價流程從人工約 20 分鐘縮到 agent 約 31 秒,每天省下超過 900 個工時,並以自家或開源模型控制數百個 agent 的 token 支出。文章同時提到不到 200 萬美元 token 成本換得數億美元效益;這些金額是公司透過媒體轉述的 claim,不能直接當成可跨公司複製的 ROI,但能提醒成本分析要把 task completion、人工工時、營收/利潤與 token 放在同一個 denominator 下。
可重用的做法不是盲目自建模型,而是先拆掉不增加價值的步驟,再判斷哪些穩定、重複流程值得由 domain engineers 以自家或 open model 封裝。自建或採用 open model 也會引入工程、維護、資料、評測與部署成本,因此應以每項任務的完整成本與品質驗收和第三方方案比較,而不是只看 API token 單價;這和 ai-native-enterprise-governance 的 owner、observability 與 workflow-level KPI 是同一個控制面。
訂閱方案是容量政策,不是單一 token 價格
BusinessNext 2026-07-20 整理 Claude Free、Pro、Max、Team 與 Enterprise 的差異,將月費、每 5 小時/每週額度、輸出上限、模型入口與 Claude Code/Cowork 等功能放在同一張表裡。報導列示 Max 5x 與 Max 20x 的用量級距,這種分級可視為把長時間 agent 任務的 capacity budget 預先分配,而不只是購買「更強模型」。
可重用的選型規則是:先按任務頻率、長度、失敗重來成本與治理需求決定所需容量,再用 model-harness-fit 驗證方案權限、模型、工具與 harness 的實際完成率;不要把媒體整理的價格或固定「每日可問幾次」當成長期基準。方案、匯率、地區、付款平台與額度都可能調整,正式成本估算仍需回到官方帳號與文件。
金融 Agent 的完整成本:連接器、整合與人工審查
BusinessNext 2026-07-24 整理 Anthropic 的 10 種金融 Agent 範本,提醒成本不只在模型 token。Pitch、研究、估值、對帳、月結與 KYC 等工作流需要 Excel/PowerPoint 操作、企業文件存取、外部市場資料連接器、技能客製、部署整合與專業人員審核;FactSet、Moody’s、PitchBook 等資料供應商也需要企業自己的訂閱與 API 金鑰。這些都是每項任務的完整成本,不能被「範本可下載」或單一 API 價格掩蓋。
可重用的成本閘門是先固定任務與驗收,再比較 Cowork、Claude Code、Managed Agents 與不同模型/harness 的總成本:核心模組與共用連接器能否被重用、人工審查要花多少時間、資料授權與權限整合是否增加固定成本,以及失敗時能否停止而不觸發交易或入帳。報導將所有輸出定位為待審初稿,這使 human-in-the-loop 既是安全控制,也是成本模型中的必要工作項;子代理仍在研究預覽階段,不能把其潛在自動化收益當成已驗證 ROI。
模型成本閘門:便宜要以任務完成來定義
BusinessNext 2026-07-22 的 Gemini Flash 三模型案例,將成本管理從單一 token 單價推到模型分工:3.6 Flash 以較少 output token 處理較複雜工作、3.5 Flash-Lite 服務高吞吐日常任務、3.5 Flash Cyber 聚焦漏洞處理。文中價格、速度、token 節省與 benchmark 數字均屬 Google/第三方評測的來源歸屬,不能直接當成跨模型的獨立結論。
實作上,應先固定任務與最低品質門檻,再記錄每任務的完成率、output tokens、latency、retry、工具成本與人工審查時間,最後才決定是否把工作降級到 Lite 或專用模型。這和 model-harness-fit 的模型—harness 配對、以及 test-time-compute-evaluation 的 quality/latency/cost Pareto 觀點一致;省下 token 但增加重試或人工返工,不算真正的成本下降。
新模型的 no-op 驗證與 effort gate
BusinessNext 2026-07-29 整理 Anthropic 的 Claude Opus 5 提示詞指南,指出模型已可能主動驗證與修正產出;對小型或範圍明確的任務,無條件要求「最後再檢查一次」或派子代理複查,可能只增加 tool call、context 與 token。較小的成本閘門是先用自身任務重測 effort 與提示長度,再把驗證保留給高風險、不可逆或需要獨立證據的工作,而不是把 verifier 當成每一輪的固定儀式。
這條規則不能被簡化成「刪掉測試」:harness-engineering-for-ai-coding 的 deterministic sensors、權限限制與 human review 仍是失敗時的保險;可刪的是與模型內建行為重複、且沒有改善任務完成率的 no-op prompt。實務上用 model-harness-fit 固定 model、prompt contract、sensors 與任務集,量測品質、延遲、重試、工具成本和人工返工後,才決定是否降 effort 或移除子代理。
長時程 agent 的折舊成本
BusinessNext 2026-07-30 整理 Claude Code 團隊把 prompt、工具與框架拿來做 ablation,並把投資重心移到驗證。來源也轉述長時程 agent 可能持續執行數週、產生大量代理與進度更新;這類案例的成本不只是 token,還包括虛擬機、截圖/觀測、狀態保存、失敗重試與人工接管。
更重要的是,eval 集和 scaffold 都會折舊:模型進步後測試會飽和,舊規則也可能變成 no-op 或干擾。可重用的成本 gate 是固定一組未飽和任務,先刪規則再量測品質、延遲、retry、工具與人工成本;只有在重複失敗且回填能改善完整任務結果時才保留。這把 model-harness-fit 的模型遷移、eval-is-spec 的版本化評測與 loop-engineering 的停止條件放進同一張 task-level 成本表。
生成式媒體指南提供另一個成本切面:以 CPI(每次互動成本)觀察自動化工作流,將品牌手冊、劇本與參考圖庫等穩定 context 做 explicit caching,並讓草稿階段使用低解析度、低延遲模型,正式量產才切換高擬真模型。這補強 generative-media-agent-workflow 的成本閘門:快取折扣、模型分層與 retry 上限要和品質、延遲、儲存費及人工複核一起算,不能只引用供應商的 token 價格或折扣。
Grok 4.6:快取價格也是長時程 agent 成本
BusinessNext 2026-08-13 對 Grok 4.6 的整理指出,標準輸入/輸出費率與前代相同,但短、長文本的 cached input 價格約升至前代的 1.7 倍;這正好打在多輪對話與長時間 agent 依賴的重複 context。來源同時轉述 Artificial Analysis 的每題成本與 AA-Briefcase 回合數,但這些是來源方/第三方 attributed claims,不是 AI Ark 的獨立成本基準。
可重用的成本 gate 是把 model + harness + cache policy + task outcome 放在同一張表:記錄輸入/輸出 token、cache hit、tool-call 回合、retry、延遲、人工返工與任務完成率。模型若以較少回合完成長任務,可能抵銷較高的快取單價;反之,若 self-check 只增加回合而沒有改善結果,就不算成本下降。這要和 model-harness-fit、test-time-compute-evaluation 的任務級評測一起驗證。
Polsia:算力單價是「一人公司」的規模上限
BusinessNext 對 Polsia 的案例指出,AI 代理團隊能把程式、廣告、社群與客服串成背景工作流,但原先使用 Claude 時的單月帳單曾高到讓多數客戶帳戶虧損,之後轉向自行部署開源模型。這是公司/媒體轉述,不是獨立成本 benchmark;可重用的訊號是,當 agent 接手更多例行任務,模型推論、整合、觀測、外包與人工審查會一起成為每任務完整成本。
因此成本閘門不能只問「能不能少雇人」,還要固定每位客戶/每項任務的完成率、推論支出、retry、連接器、人工接管與收入貢獻。若以自部署模型降低 token 單價,仍須把 GPU、維運、模型遷移與品質退化納入比較,並用 model-harness-fit 驗證完整工作流是否真的更便宜。
Appier:把 token 放回 business denominator
BusinessNext 報導 Appier 讓每位員工使用數個 Agentic AI,並以人均毛利、研發週期與核心自由現金流觀察內部導入;公司另稱 token consumption 可由儀表板追蹤,增幅低於毛利提升。這是公司/媒體案例訊號,不是獨立 ROI 證明,但它提供一個可重用的成本表:任務完成與財務分母 要和 token、工具呼叫、retry、人工接管與品質一起量測。
因此,企業不能只問「用了幾個 agent」或「token 是否上升」;要先指定 workflow KPI、成本 owner、資料來源與失敗停止條件,再判斷 agent 是否真的提高每項任務的價值密度。這和 ai-native-enterprise-governance 的治理控制面、ai-fitness-and-enterprise-ai-maturity 的成熟度診斷相連。
Gemini 3.7 Flash:便宜不是單一 token 價格
BusinessNext 2026-08-14 對 Gemini 3.7 Flash 的整理把模型成本閘門再往前推:促銷價、每秒輸出速度、單一任務時間、coding/agent benchmark 與每任務成本要一起看,不能只拿輸入/輸出 token 單價作決策。來源轉述 Gemini 3.7 Flash 在部分 coding、文件問答與企業軟體代理測試領先,但在其他長程工程與終端機代理測試落後 GPT-5.6 Terra;這些價格與評測數字仍是 Google/第三方/媒體 attribution。
可重用的成本表應至少包含 model + harness + task outcome:品質門檻、latency、輸入/輸出 token、cached input、tool-call 回合、retry、人工審查與每任務美元成本。若中階模型已能以可接受品質完成工作,先用 model-harness-fit 與 test-time-compute-evaluation 驗證 Pareto frontier,再決定是否升級旗艦模型;促銷期、標準價與動態定價都應視為會變動的部署條件,不是永久 benchmark。
Gemini 訂閱層級:容量 budget 與模型成本要分開
BusinessNext 2026-08-17 對 Gemini 3.7 Flash 的修訂版把 API 促銷價、Flash-Lite/Flash/Pro 的任務分工,以及 Google AI Plus、Pro、Ultra 5x、Ultra 20x 的算力額度與 agent/Workspace 功能放在同一個選型案例。可重用的判準是:訂閱月費與額度是 capacity budget,模型與 API 價格是 unit cost,工具、背景執行、檔案/context 限制與人工審查則是 workflow cost;三者不能只用一張價格表代替。
實作上,先固定任務分布與最低品質門檻,再比較每任務的完成率、算力/token、延遲、retry、工具呼叫、人工接手與月度容量消耗。低風險高吞吐工作可先用 Flash-Lite,需推理與澄清時用 Flash,只有高難度跨檔案或程式任務在 eval 證明值得時才升級 Pro/更高訂閱;產品價格、模型 rollout、地區資格與促銷期都應視為會變動的部署條件。這與 model-harness-fit 和 test-time-compute-evaluation 的 quality/latency/cost Pareto 一致。
影片生成的 fidelity ladder:先預覽,再升級正式輸出
BusinessNext 2026-08-28 整理 Gemini Omni 1.1 Flash 的 360p 預覽、1080p/4K 升頻、場景延伸與首尾影格插補,提供一個把生成媒體成本拆成階段的案例。可重用的成本閘門是先用低解析度確認分鏡、延伸點、首尾影格與視覺連續性,再把高解析度生成留給已通過檢查的版本;來源轉述的速度與成本比例仍是 Google/BusinessNext attribution。
這種 fidelity ladder 不是只追求較低的 token 價格:要把預覽失敗、重生次數、影片長度、解析度、人工檢查時間與最終可交付率一起記錄。若場景延伸或首尾插補減少了重做,節省可能來自較少 retry 與較早發現錯誤;若高解析度只是延後暴露連續性問題,則不算真正的成本下降。這與 generative-media-agent-workflow 的 draft/production 分層、model-harness-fit 的任務級配對及 test-time-compute-evaluation 的 quality/latency/cost Pareto 相連。
產線接線與評測
- 新模型接線前,先用基準測試和內部題庫驗證,再觀察上線後約 30 天內的最佳化收斂
- 多模型 harness 要特別注意 cache affinity,模型切換過多會讓快取斷裂
[[agent-trace-observability]]的做法也適用於成本分析:沒有資料,就很難判斷是模型退步、快取失效,還是流程出問題
觀測與衡量
- 不要把 token consumption 當成 adoption 成功的 proxy
- 以 value per 1,000 tokens、tasks completed、tickets resolved、code shipped 這類 business denominator 來看效益
- 如果消耗上升但產出沒增加,代表經濟模型已經失衡
Fable 5.1:cache discount 不等於 task cost 下降
Anthropic 官方宣稱 Fable 5.1 在典型 token-billed workload 的總成本估計低約 25%,高度 agentic workload 最多低約 45%,核心變更是 cache read 降至每百萬 token 0.25 美元;但 Artificial Analysis 以自身 Intelligence Index 的 max-effort 任務試算,報告 Fable 5.1 每任務 3.76 美元,高於 Fable 5 的 3.14 美元,原因之一是 output tokens 約增至 1.7 倍。兩者不是同一 workload、effort 或成本分母,不能擇一當成通用價格結論。
可重用的成本表應同時記錄 effort、輸入/輸出/cache tokens、cache hit、tool-call 回合、fallback、retry、延遲、人工審查與任務完成率。新模型的 cache 折扣可能被更長的 reasoning/answer 抵銷;反過來,較低 effort 可能降低完整任務成本,但只有在品質門檻不掉、硬答與返工沒有增加時才算節省。這是模型發布與 Artificial Analysis 報告提供的 task-level 判準,不是 AI Ark 的獨立帳單或 ROI 測量。
Gemini 3.8 Flash:token 單價不等於 task cost
Google 官方稱 Gemini 3.8 Flash 維持 3.7 Flash 的 introductory price,但複雜任務會多做 reasoning、反覆呼叫工具,可能消耗更多 token;3.7 Flash 仍適合 efficiency-first workload。這表示「同一 token 單價」不等於「同一任務成本」,而且 2027-01-01 起官方價格還會由 0.75/3.75 調整為 1.50/7.50 美元每百萬 input/output token。上述是供應商產品與價格說法,不是 AI Ark 的帳單測量。
可重用的成本 gate 是固定 model、effort、tool loop、task distribution 與品質門檻後,記錄 output/input tokens、tool-call 回合、retry、latency、人工審查與完整任務成本;若 3.8 的額外推論提高完成率,才有可能抵銷 token 增量,若只增加回合而沒有改善結果就不算節省。資安專用模型還要把 Fairwind 的存取資格、治理要求與受限用途列為 workflow cost/release constraint,而不是只比較模型單價。
Muse Spark 1.3:推理預算可能抵銷 token 效率
Meta 官方對 Muse Spark 1.3 的 coding comparison 稱,相較 1.2 約少 20% tool calls、25% tokens;Artificial Analysis 卻在其 Intelligence Index workload 估算 xhigh 每任務約 0.55 美元,高於 1.2 的約 0.40 美元,並指出 1.3 agentic evaluations 的 input tokens 約多 57%。兩者不是直接矛盾:前者是產品端常見 coding workflow 的相對比較,後者是第三方綜合評測的 task-cost 分母,不能合併成通用成本結論。
這個案例補強一條成本 gate:少 tool calls/少 token 只代表某個 workload 的局部效率,不代表完整任務成本下降。評估新模型時要同時記錄 model variant、effort、input/output/cached tokens、tool-call turns、retry、延遲、人工審查與任務完成率;若 max 以更多 reasoning steps 換取較高 agentic 分數,額外推理成本也要列入。正式選型前,應以固定 task distribution 和既有 harness 重測,而不是用 token 單價或單一 Intelligence Index 分數替代帳單與品質資料。
Databricks:效率前沿、路由與漸進式成本治理
BusinessNext 整理 Databricks 的 AI coding 成本方法,新增一個可重用的順序:先以符合自身開發情境的自動化 task eval 找 efficiency frontier,再讓 model、harness、request/task routing 與 escalation/delegation 可以獨立調整,最後用 visibility → spend gates → downshift → suspension 管理預算,而不是一達額度就全面停用。Databricks 的 Smart Router「平均 task cost 降低超過 30%」與近 50% token reduction 是公司內部結果,不能當成 AI Ark 的跨企業 benchmark。
這補強既有的 model + harness + task outcome 成本表:Meta-harness(如 Databricks 的 Omnigent)把共同操作介面、底層模型/harness、政策與 session 協作拆開;AI Gateway 則把模型 proxy、成本 attribution、預算、權限、工具配置與 trace 收到同一個 control plane。路由是否真的省錢仍要看 cache hit、context 重送、tool-call 回合、retry、品質與完整任務成本,不能只看單次 token 價格或模型名稱。
路由策略還有一個重要邊界:Claude Advisor 在決策點呼叫較強模型,但每次 advisor call 讀取完整對話並另計 token;Cognition 的 Devin Fusion 則以 sidekick 的持久 context 與 dynamic mid-session routing,在其 FrontierCode 設定下報告最高約 60% 成本差異。前者可能以較少高階模型回合換取成本,後者可能以快取與委派減少昂貴工作,但兩者都必須用固定任務、模型、harness、effort 與 cache policy 重測。