← 文章 / AI技术
The Decoder 5小时前 · 2026-08-28 18:10:18 · 3 阅读

研究发现:AI购物Agent还没准备好替你买单

Image description

宾夕法尼亚大学沃顿商学院的研究人员测试了 AI 购物代理在搜索过程发生变化时推荐产品的稳定性。结果显示,上下文中的微小变化就能让购买决策大幅摇摆。

该团队测试了六款当前主流模型,既包括 mini 版本也包括旗舰级模型,让每一款扮演个人购物助理,从固定的商品网格中挑选一款运动手表。他们使用了 ACES 模拟器(Agentic e-Commerce Simulator),向 AI 代理展示商品页面的截图。代理分析图像,可选地引入推荐信源,然后挑选一款产品。

这就是研究中模型接收商品信息的方式。| 图片来源:Kumar et al.

单一信源就足以翻转推荐结果

即使没有外部信源,各模型也表现出不同的基线偏好。但当代理在商品页之前只看到一条外部信源时,部分情况下的推荐结果发生了剧烈偏移

研究人员测试了三种信源:一个推荐 Garmin Forerunner 55 的 Reddit 帖子、一篇关于 Fitbit Inspire 3 的 Wirecutter 评测,以及一篇介绍 WHOOP 5.0 的 Strategist 文章。其中 Wirecutter 的影响力最强。与对照条件相比,Claude Opus 4.8 选择 Fitbit Inspire 3 的概率跃升了 90 个百分点,Gemini 3.5 Flash 则跃升了 99 个百分点。

像 Wirecutter 这样单一的外部信源就会让大多数模型的产品选择发生剧变。在对照条件下,每个模型也表现出不同的基线偏好。| 图片来源:Kumar et al.

在第二项实验中,代理会看到两到三种信源的组合。然而多种信源并未让推荐趋于平衡。只要 Wirecutter 出现在组合之中,它往往就会主导大多数模型的选择,尽管影响强度各有差异。研究显示,信源越多,结果反而越不稳定。

组合多种信源并不能让推荐结果趋于平衡。只要 Wirecutter 在场,它就会主导选择。| 图片来源:Kumar et al.

相同信源,顺序不同,结果也随之改变

在第三项研究中,代理会以不同顺序接收全部三种信源。一个稳定的决策过程在内容完全相同时本应给出相同的结果。事实并非如此。

Gemini 3.1 Flash Lite 最为敏感,随着信源顺序不同,它选择 Fitbit Inspire 3 的概率在高于对照条件 2 到 56 个百分点之间大幅波动。Claude Haiku 4.5 则保持稳定,始终停留在 41 到 42 个百分点之间。研究人员据此得出结论:呈现顺序本身就是驱动产品选择的一个因素。

当三种信源以不同顺序呈现时,大多数模型的产品选择都会发生偏移。Claude Haiku 4.5 等模型保持稳定,而 Gemini 3.1 Flash Lite 等则大幅摇摆。| 图片来源:Kumar et al.

信源是逐条还是打包传给模型同样有影响。采用打包方式时,GPT-5.5 选择 Fitbit Inspire 3 的情况多出 53 个百分点,而逐条呈现时只多出 6 个百分点。

记忆片段可以压过产品本身的客观优势

在第四项实验中,研究人员修改了商品网格,让其中一款产品在所有可衡量维度上都占优:一款带 Alexa 的智能手表,售价 29.99 美元,评分 5.0(满分 5.0),拥有 430 条评论。其他所有产品售价至少 359 美元,且评论数更少。

随后他们加入诸如"I love hiking!"(我爱徒步!)这类简短的用户记忆陈述。对若干模型而言,这些陈述使选择转向了更贵的产品,即便客观上更优的选项就在眼前。Claude Opus 4.8 选择 Garmin Vivoactive 5 的比例跃升了 75 个百分点,GPT-5.5 跃升了 37 个百分点,Gemini 3.1 Flash Lite 跃升了 36 个百分点。

像"I love hiking!"这样简短的用户记忆陈述,会把大多数模型从客观最优的产品推向更贵的替代品。只有 Gemini 3.5 Flash 基本保持稳定。| 图片来源:Kumar et al.

Gemini 3.5 Flash 的抵抗力最强,无论是否存在记忆陈述,它在 86% 到 92% 的运行中都选择了客观最优的产品。GPT-5 Mini 则表现出一种奇怪的模式:正面的徒步陈述没有让它显著转向 Garmin Vivoactive 5,但负面的陈述("I don't like hiking!")却显著推高了 Fitbit Versa 4 的选中率。

没有一致性,就没有可控性

对购物者而言,该研究表明,让 AI 代理代你购物并不能保证购买决策一致或最优。两个用户发出相同的查询,或者同一个用户在不同日期,都可能得到毫无可见理由的不同产品推荐。人类的购买决策同样不稳定,但这绝非人们对 AI 购物助手抱有的期待。任何在 ChatGPT 或类似工具中设置过记忆的人也应当知道:它可能以难以预料的方式影响购买推荐。

对卖家而言,研究人员认为,这些结果表明面向 AI 购物的优化将比传统 SEO 更难。卖家不知道是哪个模型在替人购物、它此前读过什么,也不知道它的技术配置会如何处理信息。

没有炒作的 AI 新闻 – 由人工精选

订阅 THE DECODER,即可享受无广告阅读、每周 AI 新闻通讯、每年六期的独家「AI Radar」前沿报告、完整档案访问权限以及评论区的参与资格。

立即订阅

深入了解全貌。
订阅无炒作的报道。

  • 无限制访问 THE DECODER 的全部文章
  • 无广告
  • 参与评论和社区讨论
  • 每周一封 AI 新闻回顾邮件
  • 每年 6 期:「AI Radar」——深入解读最重要的 AI 话题
  • 每日 AI 新闻,永远保持最新
  • 完整十年档案库
  • 由拥有 10 余年 AI 经验的团队报道
订阅 The Decoder
原始来源: The Decoder

评论 (0)