专家实测:AMD双卡工作站成本优于ChatGPT,高频用量下硬件更具性价比
- 两张 AMD 显卡总成本 18,775 美元,数小时内即可在周用量上击败 GPT-5.6 Sol
- Multi-Token Prediction 让吞吐量几乎翻倍,达到每秒 320.2 token
- 月生成两千万 token 的团队,按 Sol 定价算,每年可省 11,738 美元
一位硬件评测者将一台双 GPU 的 AMD 工作站与云订阅价格进行对比,以判断哪种方案在长期来看 AI 推理成本更低。
工作站内安装了两张 AMD Radeon AI PRO R9700 显卡,每张配备 32 GB 显存,实测总成本约 18,775 美元。
评测指标涵盖功耗、token 吞吐量以及硬件分摊成本,并与多个层级的云订阅价格进行了对照。
Latest Videos FromTechRadar在此观看完整视频:云定价如何划定基准
云 AI 服务商按每百万生成的 token 收费,价格从 GPT-5.6 Luna 的 1.20 美元到 GPT-5.6 Sol 的 30 美元不等。
中端模型价格居中,Claude Sonnet 5 为每百万输出 token 10 美元,Claude Opus 5 为 25 美元。
团队原本使用的云模型越贵,自有硬件回本越快。
在这台工作站上同时运行两张 AMD 显卡,测试中支撑八名用户并发时,生成速度为每秒 156.2 token。
一项名为 Multi-Token Prediction 的加速技术让该数值几乎翻倍,吞吐量提升至每秒 320.2 token,且输出质量保持一致。
在每秒 320.2 token 的速度下,这台机器每周仅需使用 3.5 小时即可在成本上胜过 GPT-5.6 Sol,使用 4.2 小时胜过 Claude Opus 5,使用 8.8 小时胜过 Gemini 3.1 Pro。
对于每月生成量超过两千万 token、且原本按 GPT-5.6 Sol 定价计费的团队而言,使用这套自有硬件确实能带来可观的节省。
在该用量下,运行工作站每年的电费及硬件分摊成本约 6,262 美元,而对应的 Sol 费用约为 18,000 美元。
这 11,738 美元的年差额,正是支持“高频月用量下 AMD 这套硬件值得投入”这一论断的实际依据。
如果企业转而使用 GPT-5.6 Luna,其价格仅为每百万 token 1.20 美元,那么上述结论将完全反转。
这样算下来,工作站每周需要使用 94.3 小时,才能追平那个便宜得多的云端订阅的总成本。
而一周总共只有 168 小时,除非近乎全天候满负荷使用,否则很难真正达到这个盈亏平衡点。
电费在整个对比中只是个小因素,因为两张显卡在持续负载下合计功耗也不过在 310 到 510 瓦之间。
什么情况下经济性会倒向 AMD
如果是一个较小的团队,每月只产出 500 万 token,按 Gemini 3.1 Pro 的价格对比,每年要花 6,262 美元来替代仅 720 美元的云端成本,明显不划算。
这说明只有当使用量高到足以填平巨大的年度成本差距时,这套硬件在财务上才说得过去。
单独一张 R9700 就能跑起一个 80 亿参数的 AI 模型,无需第二张卡辅助,处理速度达到每秒 34.5 个 token。
只跑一张卡还能进一步降低实际的盈亏平衡点,因为同等负载下单卡功耗要低得多。
这张卡根据并发用户数量不同,功耗在 221 到 283 瓦之间,远低于双卡合计的 310 到 510 瓦。
因此,较小的模型提供了另一条实现正向经济性的路径:轻量工作负载可以早早撑起 1,880 美元的单卡采购,而不必等到团队能证明 3,760 美元双卡升级的必要性。
不过,单看价格还无法下结论,因为这些本地运行的模型在复杂推理基准测试上确实落后于顶级云端系统。
在某项独立的智能指数中,270 亿参数的 AMD 模型得分为 37 分,而 Google 的 Gemini 3.1 Pro 则拿到 46 分。
所以,追求更低 token 成本的团队,牺牲的可能不只是云订阅费,还有实实在在的推理质量。
Via Puget Systems