回文章列表
AI 整合 2026-08-29 3 min read

你的 AI 購物助理,其實比你還好騙

華頓商學院實驗發現,只要塞一篇評測文給 AI 購物助理,選中率就能暴衝九成。這篇從工程角度拆解為什麼「會變的答案」不能上生產環境,以及企業導入 AI 決策工具前該補的三道防線。

  • 同樣的商品清單,只餵一篇外部評測,AI 選中率就能跳將近百分之百
  • 換餵入順序、換打包方式,同一個模型給出不同答案,這在工程上叫 flaky test
  • 企業把 AI 當決策工具前,得先問它穩不穩,而不是先問它聰不聰明
你的 AI 購物助理,其實比你還好騙

賓州大學做過一個實驗,讓六個主流 AI 模型當購物助理,從固定清單裡挑一支健身手錶。研究人員只做一件事:在模型看到商品頁之前,先塞一篇外部評測文章給它。結果某支手錶被選中的機率直接跳了九十幾個百分點,換模型測、換順序測、換打包方式測,答案每次都在飄。最誇張的一組,放一支客觀數據完勝的手錶,價格便宜、評論數最多、評分最高,結果只加一句「我喜歡健行」的使用者記憶,模型就把選擇往貴三倍的那支移了七十五個百分點。

這在工程上,叫做壞掉的測試

我帶團隊十幾年,看到這組數據的第一反應不是驚訝,是熟悉。同樣的輸入,換個順序、換個打包方式就跑出不同結果,這種東西在我們這行有專有名詞,叫 flaky test。標準處理方式只有一種:先把它 disable 掉,絕對不會讓它接上刷卡流程或關鍵決策。可是現在一堆企業把 AI 助理直接接進客服、選品、報價,卻沒人問過它穩不穩,只問它聰不聰明。這是本末倒置。

企業導入 AI 前,該先做這三件事

  • 先測穩定度再測聰明度:同一個提示、同樣的資料,跑五次,答案有沒有亂跳,跳的話問題在模型還是在你餵的資料順序
  • 把外部資訊來源當作攻擊面管理:你的 AI 助理讀了什麼網頁、什麼評測、什麼記憶欄位,這些都該被記錄、被稽核,不是黑箱
  • 不要把使用者記憶當萬靈丹:一句隨手寫的個人化描述,可能讓系統往你原本不想要的方向偏,記憶欄位需要邊界設計,不是塞越多越聰明

我們接過不少企業導入 AI 客服或選品邏輯的案子,最常見的坑不是模型不夠強,是企業把它當成一個穩定的黑盒子直接上線,結果同一句話問兩次答案不一樣,客戶投訴才發現問題。真正該做的,是先把整套流程當成一個系統來測,找出哪裡會飄、哪裡要鎖死、哪裡可以放手讓模型發揮。

以前做 SEO,現在做 AEO

以前商家對搜尋引擎做 SEO,現在戰場換成對你的 AI 助理做內容操作,而多數人連自己的助理出門前讀了什麼都不知道。企業如果要把 AI 放進決策流程,第一步不是選模型,是先把「輸入來源、記憶欄位、餵入順序」這三個變數摸清楚,這才是能不能上線的真正門檻。

會因為餵資料的順序而改答案的系統,不叫智慧,叫地雷。