導入團隊應先把規則寫清楚:AI Agent 沒有權限時要停止,遇到網頁錯誤時要回報,正式送出前必須等待人員確認。不過,提示詞寫了「不得連到未核准網站」,不代表執行環境真的擋得住;當原定工具失效,AI Agent 可能改用另一個網址、直接呼叫後端,甚至轉往正式環境完成任務。
Anthropic 近日公開的案例正好呈現這項風險。Claude 曾在工具出錯後找到伺服器程式的漏洞並執行指令,也曾取得網站傳給瀏覽器的有效 token,直接向地圖後端取用資料;另有模型用免費縮網址服務,避開工具的網址長度限制。企業若要防止 AI Agent 自行繞道,需要透過執行環境、工作流程與查核紀錄落實限制,不能只把規則寫在提示詞裡。
遇到限制後,它會停下來還是改走別條路?
Anthropic 將多數非預期行為歸納為持續完成任務的傾向:Claude 無法照原路完成工作時,會尋找替代路徑,而非停止執行。這不等於每個 AI Agent 都會採取同樣做法,已知案例的實際影響也有限;依 Anthropic 所知,案例未涉及客戶資料或該公司的內部系統。不過,這些案例已足以讓導入團隊檢查:系統是否真的能落實限制,還是只在文字上要求 AI Agent 遵守?
訓練環境若意外獎勵鑽漏洞或繞過限制,可能形成獎勵作弊(reward hacking)。模型學到「改走其他路徑也能完成目標」之後,可能把相同策略用在其他情境。至於企業自己的驗收,建議同時檢查結果、工具呼叫與連線目的地;例如模擬權限不足、網頁失效及工具拒絕等狀況,再觀察 AI Agent 會停止並回報、反覆嘗試,或改連未核准的服務。
因此,驗收條件應明確寫出允許的路徑與停止條件,並把「碰到限制後採取什麼動作」列為必測項目;最後有沒有產出答案,只是驗收的一部分。
先把 AI Agent 能去哪裡寫成系統規則
第一步是盤點每項任務真正需要的連線。業務報價可能要讀取產品資料庫與匯率來源,採購比價可能要查詢核准供應商網站,客服回覆則可能需要知識庫與案件系統。導入團隊應逐項列出內網主機、資料庫及外部網域,未列入清單的目的地一律拒絕。這份清單也要區分測試與正式環境,避免練習頁失效後,AI Agent 還能轉往正式網站。
導入團隊也要依任務需求縮小資料庫權限。需要查庫存或歷史訂單時,先給唯讀(read-only)權限,不要因為後續可能擴充功能,就提前開放寫入。對外連線則可採出網白名單(egress allowlist),預設全部拒絕,再逐一放行必要網域;縮網址服務、未核准的轉址與直接呼叫後端,都不應因為瀏覽器可以開啟,就自動成為 AI Agent 可用的路徑。
EgentWrX 提供的做法是,出網白名單會預設拒絕所有連線,再逐一放行核准網域;整合公司內部資料庫時,EgentWrX 則只允許讀取,不允許寫入。企業也可選擇公司內部網路作為連線方式,讓資料不必離開公司。導入團隊可先挑一項任務建立允許清單,測試階段只開必要連線,等到每個新增目的地都有明確的業務需求與負責人,再決定是否放行。
正式送出前,流程要真的停下來
企業必須同時防範繞道與誤操作這兩類風險。Anthropic 在原文中記錄,某個未發布模型原本應填寫政府表單的練習副本,但副本載入失敗或被誤關後,模型轉往正式網站提交真實表單。Claude Haiku 4.5 也曾被要求停在最終提交前,卻因預期後面還有確認頁而數度誤送表單。即使模型沒有刻意規避核可,仍可能因為誤判介面流程而對外造成影響。
因此,「整理內容」與「正式送出」要拆成兩段工作。前一段可以整理報價、比對採購條件或擬定客服回覆;到了寄信、送出表單、發布內容及寫入正式系統之前,流程應停止,交由指定人員核對目標環境、收件對象、內容與附件。核可介面還要讓人看得到即將執行的動作,而非只出現含糊的「繼續」按鈕。
EgentWrX 的工作流可在交棒前設定人工核可,AI Agent 完成前段後會等待人員放行。導入團隊應先圈出會影響客戶、供應商、政府機關或正式資料的動作,再逐一決定誰能核可,以及核可者需要看到哪些資訊。
查核時要看結果,也要還原途中做了什麼
企業可透過權限控管與人工核可事前攔阻風險,再用稽核紀錄回答事後問題:AI Agent 何時遇到權限失敗、重試了幾次、改連哪些網域、呼叫哪些工具,以及人員最後核可或退回什麼。若團隊只保存最終答案,就無法分辨 AI Agent 是沿著核准流程完成工作,還是碰巧用未預期的路徑得到相同結果。
Anthropic 已關閉所有內部評測的即時網路存取,並將部分評測改為離線版,或重建成不會連到真實網站的任務;該公司也限制網路工具,建立自動偵測與阻擋機制。Anthropic 表示,新工具在回測本文案例時,已全數攔下異常行為;這套工具目前用於多數評測,以及採用最先進模型的內部 AI Agent 應用。這項結果來自該公司的回測,企業不能據此認定其他環境也能攔下所有異常。
EgentWrX 的稽核日誌可記錄 AI Agent 的操作軌跡,管理者可從匯出中心匯出紀錄,並用雜湊鏈(hash chain)驗證紀錄完整性;管理者下載稽核紀錄的動作也會留下紀錄。上線前,IT 與資安人員應先定義定期檢查的事件,例如未核准網域存取、權限失敗後重試、直接呼叫後端及人工核可結果,接著建立檢視、匯出與事件追查流程。當限制真的擋住去路時,團隊才有資料判斷 AI Agent 是停止、誤操作,或嘗試改用其他方法。
