決策者評估 AI Agent 平台時,最常問的第一句話是「你們用哪個模型」。這句話問的是引擎,不是車。同一具引擎裝在不同的車上,能跑多遠、煞不煞得住、載不載得動貨,差別很大。
AI Agent 也是這樣。真正決定它在你公司裡好不好用的,往往是模型外面那一層很少被搬上檯面的東西:Harness。
Harness 是包在模型外面的執行框架
Harness 原意是馬具。一匹力氣驚人的馬放到野外,沒辦法幫你把貨運到目的地;套上韁繩與車架之後,那股蠻力才變成能穩定拉車、往你要的方向前進的動力。
大型語言模型(LLM)就是那匹馬。它本質上是文字預測引擎,光靠自己並不能穩定完成一連串真實任務。Harness 就是包在模型外面的那整套執行框架,負責把模型的判斷轉成實際動作。
Harness 管的六件事,對決策者來說是六種風險
把 AI Agent 想成一輛馬車,Harness 就是馬以外的一切:韁繩、車架、煞車。它管六件事,而每一件在事故檢討或稽核時都會被問到。
- 代理迴圈:讓助理反覆「想下一步、動手、看結果、再想」,直到任務完成。少了它,助理回答一次就停住,多步驟的工作走不完。
- 工具調度:模型說「我要查資料庫」的時候只是輸出一段指令,不會自己動手。Harness 讀懂指令、去呼叫工具、把結果餵回模型。查料號、寄信、讀訂單,都靠這一層真的被執行。
- 情境與記憶管理:模型每一輪讀得進去的資訊量有限。Harness 決定這輪放哪些內容進去,塞不下時把舊對話濃縮成摘要,讓助理不會因為忘記前面而出錯。
- 錯誤處理與重試:工具呼叫失敗、輸出格式跑掉的時候攔下來,自動重試或要求模型修正,流程才不會一出錯就卡死。
- 權限控管:規定這個助理能做什麼、不能做什麼。刪資料、對外發訊息這類高風險動作,先攔下來要人確認。
- 停止條件:判斷任務何時算完成、何時該喊停,避免助理在原地反覆空轉,把成本耗掉。
提示詞、情境、Harness:三層各自對應誰的責任
這三個詞很容易混在一起,分工其實清楚:前兩者管「給助理什麼」,Harness 管「怎麼一輪一輪把它跑起來」。
用交辦任務給新同事來看:
- 提示詞工程:把交辦的那句話寫清楚,講明要做什麼、用什麼角色、輸出成什麼格式。這是跟模型溝通的最小單位。
- 情境工程:把整張工作桌佈置好。除了那句指令,還包含幾個做好的範例、該查閱的資料、要記得的背景,以及能動用的工具。提示詞只是桌上的其中一項。
- Harness:提供執行環境。接到任務就自動重新佈置工作桌、驅動他執行、出錯請他重來、遇到危險動作先攔下來請示,直到任務完成才收工。
前兩層是內容,Harness 是機制。Harness 每輪替助理組裝上下文所做的事,本身就是自動化的情境工程。
這個分層對決策者有實際用處:它告訴你出問題的時候該找誰。輸出格式不對,是提示詞的事,寫的人自己就能改;助理查不到該查的資料,是情境的事,要補知識庫或開權限;助理該停的時候不停、該問人的時候不問,那是 Harness 的事,換提示詞救不回來。
試辦都會過,上線才見真章
傳統產業導入 AI Agent 常遇到同樣的落差:試辦看起來很好,真的交給現場用就不行。
原因通常不在模型。試辦階段有人在旁邊看著,助理答錯就手動重來、工具掛掉就人工補、遇到不該碰的資料是人在把關。這些工作上線之後沒有人做,全部落到 Harness 身上。錯誤處理、停止條件、權限攔停,試辦期間幾乎用不到,上線第一週就會全部用到。
所以評估平台時,看示範的準確率意義有限。該問的是出錯時它怎麼處理、誰有權限批准高風險動作、每一次執行留不留得下紀錄。
三個問題,問的都不是模型
- 這個助理做錯了會怎樣? 答案應該是具體機制:自動重試幾次、攔停之後通知誰、失敗的任務會不會留在待處理清單裡。若答案是「模型很準」,那是答錯題。
- 哪些動作需要人核可? 高風險動作的清單與核可流程應該設定得出來,而不是靠在提示詞裡叮嚀助理小心。
- 上個月它做過的事查得到嗎? 執行紀錄是稽核與事故檢討的前提。查不到,等於這段流程在公司裡沒有帳。
自建的成本不在建起來,在養下去
要從零做一套可靠的 Harness,得包含代理迴圈、工具調度、記憶與情境管理、錯誤處理、權限控管、執行監控,工程量已經不小。真正沉重的是之後:模型換版、工具介面改、權限規則調整,Harness 都得跟著動。傳統產業的 IT 人力配置本來就緊,這條路的維護負擔會長期壓在同一批人身上。
多數企業更務實的做法是直接用一套已經做完、而且能被治理的 Harness。智慧方案的 EgentWrX 把這一層備好了:代理迴圈、透過 MCP 串接的工具調度、記憶與知識庫、權限控管與執行紀錄,整合在同一個平台裡。企業不必自己造車,就能替每個 AI Agent 裝上引擎室。
AI 是那具引擎。握著韁繩、決定要去哪裡、什麼時候該踩煞車的,始終是人。
