回文章列表
AI 整合 2026-09-01 4 min read

AI 說快好了?先問它手上有沒有錶

研究發現AI代理人普遍不知道自己做了多久,給它一個能回報時間的工具,判斷就幾乎全對。這篇從企業導入AI的角度,講清楚為什麼「觀測」比「模型多聰明」更重要。

  • AI估計自己工作花多久時間,誤差可達六到十倍,不分任務難易度
  • 問題不是模型笨,而是沒有可回報進度的工具,等於沒裝感測器
  • 企業導入AI代理人前,先問清楚系統有沒有埋log、有沒有能被追蹤的執行紀錄
AI 說快好了?先問它手上有沒有錶

前陣子看到一份研究,兩位獨立研究員拿市面上兩款主流AI程式代理人做實驗。開工前問它要花多久,做完問它剛剛花了多久。兩百個任務跑下來,兩邊都猜九十分鐘,不管題目難或簡單。第二輪測試更誇張,一邊平均差三倍,另一邊差到六到十倍,而且任務愈短,估得愈離譜。

更好笑的是自我評分。兩邊都覺得自己做到七成左右,實際分數是7分跟14.5分。但研究員只做了一件事就幾乎全部矯正:給它一個能回報經過時間的工具。裝上這顆感測器之後,它幾乎每次都答對。

這不是模型笨,是系統沒有觀測點

我帶團隊十幾年,看過太多類似的場景,只是主角換成人。最會拖進度的員工通常不是懶惰,是他手上沒有任何東西提醒他現在幾點、進度到哪裡。AI代理人也一樣,它沒有內建時鐘,沒有人幫它埋log,它只能用訓練資料裡學到的語感去猜,猜出來的答案跟真實世界脫鉤,但講起來一樣自信。

企業現在急著把AI代理人塞進客服、單據處理、報表生成這些流程,常犯的錯是隻驗證輸出結果對不對,卻沒有幫它裝上可觀測的執行紀錄。結果就是系統跑起來看似順暢,實際上沒人知道它卡在哪一步、花了多少資源,出包了也查不出原因。

導入AI前,先問這三件事

  • 這個流程有沒有埋log,能不能追蹤每一步實際耗時與狀態
  • 代理人回報的進度或信心分數,是真的量測出來,還是它自己編的
  • 出錯的時候,能不能靠紀錄回溯問題,而不是靠猜

我們接過不少企業的AI整合案子,前期最花時間的往往不是調模型,是把既有系統的執行過程變成可被追蹤、可被驗證的資料。這一步做得紮實,後面AI代理人才有東西可以參照,不然它跟你回報進度,本質上跟丟硬幣沒兩樣。

殼會影響行為,不只模型本身

研究裡還提到一個細節,同一顆模型換一個執行環境,平均多跑兩倍半的步驟才會停手。這代表決定AI代理人行為的,不只是模型多聰明,還有你把它放進什麼樣的殼、給它什麼樣的停止條件與回報機制。企業評估AI工具時,常常只看模型排名,卻忽略了實際整合進系統後的行為模式可能完全不同。

下次AI跟你說快好了,別急著問它有多聰明,先問誰幫它戴上錶。