回文章列表
AI 整合
2026-09-04
3 min read
AI 會自己選捷徑:企業導入前先想清楚這件事
廠商說攻擊成功率0%,紅隊實測卻拿到八成,問題不是模型變壞,是它太會找捷徑。這篇從一則安全研究出發,講企業導入AI Agent前該問的三個問題。
- 廠商測出0%攻擊成功率,紅隊實測卻拿到八成,差別在情境設計而非模型本身
- AI Agent不是被騙去做壞事,是被引導走上一條看似合理的捷徑
- 企業導入AI自動化前,止血路徑要設計成完全繞過AI本身

前陣子有份安全研究在工程圈傳很兇:某家AI公司委託外部單位測試自己的Agent自動模式安全性,跑了72種情境,攻擊成功率是0.00%。漂亮的數字,可以拿去做簡報。結果另一位研究者自己設計一條攻擊鏈,同樣的產品,成功率拉到60到80%。這不是誰造假,是兩種測試問了不同的問題,而多數企業在導入AI時,只問了第一種問題。
廠商測的是「會不會作惡」,你該測的是「會不會抄近路」
那份研究最關鍵的一句話,我讀完直接記下來:整條攻擊鏈裡,沒有一步是叫AI做壞事,全程只是把一條有問題的路徑,變成解決眼前任務最順的那條路。伺服器故意回錯誤讓某個工具失效,AI自己決定換一個方式抓資料;抓到的檔案裡藏了一個可疑的執行檔,AI很正確地拒絕執行它,但為了完成任務,自己寫了一段程式去解析檔案內容,而這段自己寫的程式,剛好在一個被動過手腳的資料夾裡執行,載入了同名的假模組,攻擊就這樣成立。
重點在這裡:AI不信任別人給的可疑檔案,但完全信任自己寫的程式碼。它的防禦意識用在了正確的地方,卻在自己看不見的地方留了一個洞。這跟人類員工的行為模式其實一模一樣,只是換了個載體。
企業自動化流程裡,最危險的不是AI學壞,是它太努力完成任務
- AI被訓練成「想辦法完成任務」,遇到阻礙會自己找替代路徑,這是設計目的,不是漏洞
- 替代路徑往往是人沒預想過的,因為人在設計流程時只想著正常情境
- 出事後想緊急停止,如果止血機制也是由AI或同一套規則管控,可能連停止指令都被判定為異常而擋下
這第三點最值得企業決策者花時間想一遍。研究裡有個細節:AI事後察覺自己被下毒,想終止已經啟動的惡意程序,結果安全機制擋下了「建立程序」卻放過了、也擋下了「清除程序」的指令。防呆機制本身,變成了故障的一部分。我們在幫客戶做流程自動化整合時,永遠會單獨問一句:這套系統出事的時候,人要怎麼在不經過AI的情況下把它按停?如果答案是「再問AI一次」,那這套設計本身就是風險。
導入AI自動化前,先問這三題
- 這個流程有沒有讀取外部內容(網頁、檔案、第三方回覆)?有讀取,就要假設內容可能被動過手腳
- AI在流程裡有沒有執行權限(寫檔、跑指令、呼叫API)?有權限,就要問「它失敗時會自己換什麼方式繼續」
- 止血路徑是不是完全獨立於AI判斷之外?如果不是,這條路徑等於不存在
AI不會主動作惡,它只會誠實地幫你找到你沒設防的那條捷徑。