AI考試會被「亂猜」扣分,你的員工敢說不知道嗎
印度研究團隊用一種新計分方式考AI,答錯又自信會倒扣分數,結果一堆頂尖模型被自己的自信心拖垮。這篇從這個測驗聊企業匯入AI跟管理制度該有的真正態度。
- 放射科AI測驗證明答錯又自信會被扣分,多說「不知道」反而排名更前面", "企業匯入AI最危險的不是模型不夠聰明,是沒人敢承認系統哪裡會出錯", "把「知道自己哪裡不會」變成公司文化跟制度設計,比追求最新模型更重要

印度有個研究團隊給十六個頂尖AI模型做了一場放射科考試,兩百個病例,對照真人醫師。計分方式不複雜:答對加分,答錯倒扣,,說「我不知道」則是零分,不扣不加。結果呢,好幾個以為自己很聰明的模型,分數被自己的自信心扣到見底。人類醫師拿了988.7分,最強的AI模型只拿758分。
輸的不是智商,是不敢承認不會
這個測驗最狠的地方,是逼每個模型對自己的答案標一個確定度,從零到四。答錯又打包票說很確定的,扣得比隨便亂猜還重。研究團隊後來發現一件很諷刺的事:好幾個模型只要學會多閉嘴幾次,名次立刻往前跳。反倒是那些開源模型跟醫療專用模型,幾乎每題都硬答,錯得非常有自信。甚至有一款升級後的新模型,懂的東西變多了,幻覺卻也變多,因為它對自己講錯的答案更加深信不疑。
一個系統的可靠度,從來不是看它答對幾題,是看它知不知道自己哪一題在瞎猜。
我們幫企業匯入AI系統時,天天在防這件事
這幾年接觸不少想匯入AI客服、AI審核、AI決策輔助的企業,常見的坑不是模型不夠新,是企業自己沒設計「不確定的時候該怎麼辦」這條路。系統遇到模糊案例,不是老實回報「這題我沒把握,請人工確認」,而是被要求一定要給個答案,因為老闆覺得系統不能沒反應。結果就是,系統跟那些醫療專用模型一樣,錯得很有自信,而且沒人發現,因為它從來不喊救命。
- 匯入AI前先問:系統遇到低把握案例,允許它說「不確定」嗎
- 評估AI廠商時,別只看準確率,問清楚錯誤案例的信心分佈長什麼樣
- 幫關鍵流程留一道人工複核關卡,尤其是財務、醫療、法遵這類高風險場景
- 把「模型多久沒踩雷」跟「模型多常誠實喊不確定」都列進驗收指標
制度長什麼樣,團隊就長什麼樣
這件事回頭看公司管理也一樣。你公司裡上一次有人在會議上說「這個我不知道」是什麼時候?如果績效考核只獎勵答對、不獎勵誠實回報不確定,那不管是人還是AI,都會學會用猜的把場面撐過去。一個敢在會議上說「我不確定」的資深工程師,在你的制度裡值多少分?如果答案是他會被檢討,那你的團隊本質上就跟那些幻覺率飆高的模型沒兩樣,只是錯得更貴。
波蘭那份大腸鏡研究也提過類似的事,醫師習慣AI輔助之後,一旦拿掉工具,病灶偵測率反而從28.4%掉到22.4%。這不是AI的錯,是人把「依賴」跟「信任」搞混了。真正成熟的AI匯入,不是讓系統取代判斷,是讓系統誠實標出哪裡該交還給人。