企業導入AI前先問一句:你的護欄長在嘴巴上還是骨頭裡
很多企業導入AI agent只靠一句prompt交代「不要刪資料庫」,這種護欄形同虛設。這篇從技術社群的真實踩坑經驗出發,講清楚為什麼權限規則必須寫進程式邏輯,而不是寫進提示詞裡。
- 用prompt交代AI「不要做壞事」不是護欄,是許願
- 真正的權限控管要照風險分級,寫進程式邏輯而非提示詞
- 企業導入AI agent前該先盤點:哪些指令是靠嘴巴擋、哪些是靠骨頭擋

最近技術圈流傳一個很寫實的案例:有工程師想讓AI agent自動執行系統指令,一開始的做法是在提示詞裡加一句「請不要執行危險指令」。聽起來很合理,對吧?但實測結果是,agent一樣可以被誘導執行複合指令,把清單指令跟刪除指令包在一起送出去,因為模型只看得懂前面那個看起來無害的部分。這不是模型笨,是護欄本身放錯位置。
提示詞不是護欄,是許願池
我看過太多企業導入AI自動化的第一版設計,都長這樣:告訴AI「你是謹慎的助理,遇到敏感操作要三思」。這句話放在提示詞裡,本質上跟跟員工說「做事要小心點」是一樣的等級,聽起來像管理,其實什麼都沒管到。因為prompt是建議,不是規則。AI會不會照做,取決於它那天心情好不好、上下文夠不夠清楚、有沒有被繞過去的話術誘導。
技術社群裡有個很具體的實驗,把七種操作工具依風險分成三級:唯讀的直接放行、會改資料的問一次記住到工作階段結束、會執行系統指令的則逐段拆解檢查內容。判斷順序固定是先擋紅線、再問不確定的、最後才放行安全的。這套邏輯聽起來很基本,但重點在於它是寫在程式裡的判斷式,不是寫在跟AI講的那段話裡。差別在哪?一個是機器一定會執行的規則,一個是機器可能會聽的建議。
複合指令跟包裝過的請求才是真正的破口
實務上最危險的從來不是那種一看就知道很敏感的操作,而是被包裝過的複合指令。比如把「查詢清單」跟「清空資料表」串在同一段裡送出去,如果系統只檢查第一個關鍵字就放行,後面的動作就會悄悄溜過去。另一個常被忽略的細節是:只要指令裡出現變數展開、反引號、管線這類會讓「實際執行內容」跟「字面內容」不一樣的符號,就該一律攔下來問清楚,因為系統當下根本不知道那串東西展開後會變成什麼。
- 唯讀查詢:可放行,風險低
- 會寫入或修改資料:需要確認機制,且要記錄
- 涉及系統層級指令或外部程式呼叫:必須逐段解析內容,看不懂就攔
另一個常被忽略的坑:關住的路徑,關得住嗎
我們在企業導入上怎麼看這件事
你叫AI別亂刪資料,它聽不懂人話,只聽得懂程式裡寫死的if跟deny。