採購 AI 模型時,價目表很容易先成為比較依據。不過,業務報價要查歷史訂單、讀取成本資料、檢查條款,客服也可能需要反覆查詢知識庫與內部系統。模型每多想一輪、多呼叫一次工具,費用就會繼續增加;如果最後沒有交出可用結果,前面產生的費用仍須支付。
因此,企業選模型時應衡量完成工作的成本。團隊可以先從自家高頻任務取樣,統一成功條件與測試方式,再把成功、失敗的支出全部計入。模型單價可以參考,但不能單獨決定哪個模型適合哪項工作。
單價低,為什麼執行同一項測試反而更花錢?
TechOrange 報導一項由史丹佛大學、卡內基美隆大學、加州大學柏克萊分校與 Microsoft Research 研究人員共同完成的研究。研究涵蓋 8 款前沿推理模型與 12 類測試,包括數學、科學問答、程式設計,以及需要多次與外部環境互動的 AI Agent 任務。在 336 組模型與任務配對中,有 106 組出現價格逆轉,也就是 API 單價較低的模型,執行相同測試任務反而更花錢。
研究人員將兩項主因歸納為過度推理(overthinking)與過度執行(overacting)。前者會消耗過多推理 token,後者則讓 AI Agent 持續拆解工作、呼叫工具、讀取結果,再決定下一步。AI Agent 每次與外部環境互動時,還可能重新處理前面累積的任務資訊,所以輪次越多,支出也會跟著增加。
研究中的一個 AI Agent 測試案例更能說明問題:某模型執行近 1,000 個步驟,最後仍未成功。同一模型收到相同問題時,不同次執行的推理 token 消耗量最多也可相差 9.7 倍。這些結果不代表高價模型一定更省,卻足以提醒採購與 IT 團隊,單次呼叫費用無法代表整項工作的成本。採購與 IT 團隊第一步應找出哪些流程需要多次工具呼叫、容易重試,或缺少明確停止條件,並優先把這些流程列入實測。
選模型前,先把成功條件和測試方法寫清楚
建議企業先選 3 至 5 個高頻任務,例如業務報價、採購比價、品管異常摘要、客服回覆草稿或跨部門簽核資料整理。每項任務都要使用實際會遇到的輸入格式與工具,並先寫下什麼結果算成功。業務報價可以檢查必要欄位是否齊全、引用的訂單與條款是否可追溯;採購比價則可確認規格有沒有對應、差異是否標示清楚。若成功條件只寫「回答合理」,不同評估人員就可能得到不同結論。
測試時,每個模型要在相同條件下重複執行,記錄成功與否、token 耗用、工具呼叫次數、執行輪次、花費及失敗原因。研究人員已觀察到同一模型重複執行仍可能產生明顯差異,因此,一次成功或一次失敗都不適合直接作為採購決策的依據。團隊也要保留測試版本,包括任務指令、可用工具與成功條件,否則下次重測時,很難判斷差異來自模型、流程,還是測試內容已經改變。
比較結果時,可以採用「每次成功任務成本」:把所有成功與失敗執行的費用加總,再除以成功次數。採用這個指標時,團隊會把失敗與重試的支出納入同一套計算,也能避免在報告中只挑單次執行費用最低的結果。不同任務可以採用不同模型;需要判讀複雜條款的工作,可優先測試能力較強的選項,格式固定的例行整理則可測試較快、較省的選項。接下來,團隊應使用同一份測試紀錄,為每類任務選出合適模型,而非先指定一款模型再要求所有流程配合。
選好模型後,怎麼防止支出持續累積?
模型選定後,團隊仍要設定執行時間與單一工作花費上限,以及工具呼叫與重試的停止條件。當 AI Agent 遇到資料缺漏、外部系統無法回應或結果連續不合格時,流程應停下來交由負責人檢查。負責人需要先看失敗發生在哪一步、已累積多少支出,再決定更換模型、修改任務指令、拆分流程或重新啟動,不能讓系統只因排程尚未取消就一直重跑。
EgentWrX 可讓企業在同一平台選擇 Anthropic、OpenAI 或地端模型,每家都有「最強大」「均衡」「最快・最省」三種定位,企業可依前述實測結果配置不同任務。平台也可在租戶、單位、成員與 AI Agent 四個層級設定預算;若企業把門檻行為設為「擋下」,任一層先用完額度,工作就會停止。企業允許工作長時間執行時,平台會在 60 分鐘詢問是否續跑,續跑後最多 90 分鐘,單一工作花費上限為 3 美元。
對定期執行的任務,EgentWrX 會在排程連續失敗 5 次後自動暫停,並等待人員處理與重新啟動。企業仍要為每項排程指定負責人,因為暫停只能阻止費用繼續累積,不能代替人員判斷失敗原因。建議團隊每月查看哪些預算層級最常擋下工作、哪些任務最常失敗,再調整模型與流程;模型能力或價格改變時,也應使用原本的測試集重新比較,建立可驗證的選型依據並控制失敗任務的累積費用。
