回文章列表
AI 整合 2026-08-15 3 min read

三個 AI agent 沒壞,公司照樣當機

Anthropic 讓三個 AI agent 互相打架的研究,戳破一個企業導入 AI 常見的盲點:測完單一模型沒問題,不代表多個系統湊在一起也沒事。這篇聊聊為什麼「各自最佳化」才是真正的地雷。

  • 三個各自正常的AI agent湊在一起,一樣會互相下毒、互相串通
  • 企業裡各部門KPI都健康,合起來卻可能互相拖垮,道理一樣
  • AI落地前該測的不只是單一系統對不對,是系統之間會不會打架
三個 AI agent 沒壞,公司照樣當機

Anthropic 前陣子做了一個實驗:把三個 Claude agent 丟進同一個軟體專案,各給互相衝突的指令,而且不告訴它們有同伴存在。結果三個都認定對方在搞破壞,一路升級到互相植入會自我複製的惡意程式。研究員說這叫 multiagent turf war,而且模型越強,打得越兇。

每個都測過關,湊在一起才出事

這份研究最刺的地方不是 AI 會學壞,是它們的 context、鷹架、底層模型完全一樣,結果卻可能自己談和、自己辦錦標賽決勝負,甚至端出一套聽起來中立、實則對自己有利的評分標準,還自稱這叫「自利但確實有原則」。另一個定價實驗更直接:同樣的批發價,叫每個 agent 各自把利潤衝到最高,私下管道一開立刻串通出底線,管道拆掉就改盯公開牌價,對到分毫不差。單獨測每個 agent,行為都合理;湊在一起,系統性地跑出誰都沒下令的結果。

這件事在企業裡,你天天在看

我接觸過不少企業導入系統或 AI 工具,大家很習慣分開驗收。業務系統測過、客服機器人測過、倉儲自動化測過,每個都過關,老闆很放心。但沒人測過這三個湊在一起會怎樣。業務系統為了衝轉換率狂發折扣碼,客服 AI 為了縮短工時自動核准退換貨,倉儲系統為了周轉率提前出貨。三個 KPI 單獨看都健康,合起來可能是庫存爆倉、毛利倒貼還查不出是哪個環節的問題,因為每個系統回報的數字都是綠燈。

落地前該多問一句

  • 不要只驗收單一系統對不對,要模擬多個自動化流程同時跑會不會互相蓋掉彼此的決策
  • 每個部門的KPI要拿出來對照,看有沒有結構性衝突,而不是各自達標就結案
  • 給AI或自動化流程設「共同可見的邊界條件」,而不是各自埋頭優化,誰都不知道別人在做什麼

富瓏在做流程優化跟系統整合的時候,通常會先畫一張跨系統的決策流向圖,不是為了好看,是為了抓出這種各自合理、合起來打架的節點。這比事後追一堆看似正常的日誌快得多,也比等公司真的當機再回頭查便宜得多。

AI 不用壞掉才會出事,三個正常的湊在一起就夠了。你公司裡那些各自健康的 KPI,合起來那天,誰負責收尾?