回文章列表
AI 整合 2026-09-15 3 min read

跑分表會騙人,連標準答案都會騙人

一篇論文意外揭露:AI 排行榜的分數,有一大塊其實是「外殼」的功勞而非模型本身。企業選型與導入 AI 前,該從這件事學到什麼實戰教訓。

  • 跑分高的AI模型,把外殼換掉分數就崩,選型別只看排行榜
  • 同一套模型加一個上下文清理機制,某項測試分數多了21.2分,證明外殼比想像中重要
  • 企業導入AI該做的不是比較模型排名,而是拿自己的真實任務跑一輪再決定
跑分表會騙人,連標準答案都會騙人

最近有篇開源搜尋 AI 的論文引起不少討論。附錄裡有一題,AI 被扣分,理由是它答錯了一個影集角色的婚配家族。結果對答案一查,出題的人自己搞錯了,AI 答的其實才是對的。這種烏龍看起來好笑,但真正該讓企業主管在意的,是同一篇論文裡另一段更誠實的自白:他們把同一個模型跑兩次,一次開啟上下文管理機制,一次關掉,結果小模型光靠這個機制,某項測試分數就多了二十分以上。

分數高,不代表模型強

上下文管理說穿了很簡單,就是 AI 在長時間查資料、對話時,記憶體快塞滿了,把舊的、不重要的內容清掉,讓它能繼續往下查。這聽起來像是工程細節,跟模型能力無關,但實測結果打臉了這個直覺。同一顆模型,殼寫得好不好,分數可以差到二十分。研究團隊自己講得很直白:排行榜上的差距,你根本分不出來是模型本身強,還是外面包的那層殼寫得漂亮。

這件事在我們接觸企業導入 AI 的過程中,其實天天在發生,只是沒人願意講破。很多企業選型時只看廠商簡報上的跑分表,或是媒體報導的某個 benchmark 排名,就決定要導入哪一套系統或哪個模型。但那張跑分表跟面試者的作品集一樣,你根本不知道哪幾頁是本人親手做的,哪幾頁是團隊代勞、後製修圖。

我們實際會怎麼做

  • 不看廠商自己公佈的分數,直接拿客戶真實會遇到的任務去跑,同一套外殼、同一個資料量、同一個上下文上限
  • 刻意測試極端狀況,例如對話拉長、資料量塞爆時系統會不會開始亂答或漏答
  • 檢查系統本身的『考卷』有沒有 Bug,很多企業內部的驗收標準,其實跟論文裡那道錯誤標準答案一樣過時或想當然爾
  • 記錄同一套模型換掉外殼前後的表現差異,這往往比換模型本身更划算

論文裡還有個意外收穫值得一提:團隊只針對搜尋能力訓練模型,結果它處理一般工具操作跟文書工作的能力也跟著變好。這呼應了我們在系統整合上常看到的現象,把一個核心流程做扎實,其他周邊能力常常會跟著提升,而不是每個功能都要單獨疊加系統去解決。這也是為什麼我們談 AI 導入,很少建議企業一次買齊十種工具,而是先把一個關鍵流程的地基打穩。

給企業的真實建議

下次有廠商拿著跑分表跟你說他們的模型或系統多厲害,先別急著點頭。問三個問題:這個分數是在什麼條件下跑出來的、外殼跟參數設定是誰調的、換成你自己的真實資料和流程會不會掉分。答不出來的廠商,代表他們自己也沒驗證過在你的場景裡到底行不行。這不是刁難,是任何要花預算的決定都該有的基本盡職調查。