GPU负责算,CPU负责干活:英特尔开始重新出牌
英特尔正在重新调整自身在 AI 基础设施中的定位。一方面,通过至强处理器承接 Agent 执行、任务编排和数据调度需求;另一方面,继续推进 GPU、存储加速、定制化芯片、先进制程与封装,将原有计算优势扩展到更完整的 AI 系统。
在英特尔技术创新与产业生态大会上,英特尔 CEO 陈立武在视频致辞中表示:“过去一年多来,我和团队致力于塑造一个焕然一新的英特尔,既传承深厚积淀,又专注于技术创新、工程实力、快速执行和客户至上的英特尔。”他强调,英特尔将依托 CPU、GPU、ASIC、先进封装、晶圆制造以及覆盖云、边、端的开放生态,把握 AI 带来的发展机遇。
英特尔重新强调 CPU 的价值
过去三年,大会的讨论重点已经从大模型应用转向推理,并进一步进入智能体时代。英特尔中国区董事长王稚聪表示,这一变化也直接影响着英特尔的数据中心产品路线。
Agent 正在让数据中心工作负载变得更加复杂。过去,大模型主要通过对话完成问答;如今,上下文工程让模型能够利用更多历史信息,Agent Harness 使模型能够调用工具并执行任务,循环工程(Loop Engineering)则让 Agent 能够反复验证和改进结果。
“这一层又一层的软件机制,听起来很简单,但其中很多工作都比较适合 CPU 来执行。这也是为什么在过去一年时间里,AI 智能体的兴起会带来对 CPU 的巨大需求。”英特尔数据中心集团副总裁兼中国区总经理陈葆立说道。
英特尔据此提出,未来 AI 数据中心将由三类服务器或集群协同组成:CPU 集群负责智能体执行和工作编排;GPU 集群承担模型计算和 Token 生成;高性能存储集群则保存上下文、历史对话及业务数据,三类集群都需要 CPU 参与数据调度。
陈葆立表示,“当我们把 Token 工厂的概念升级到 AI 工厂的时候,讨论的就不止是这个 Token 工厂能产生多少 Token,而是整个 AI 大系统如何以更低的资源消耗、更高的效率,帮助客户完成更多工作。这是一种以任务为导向的思维,也是一个完全不同的想法。”
市场预测显示,2030 年 CPU 市场规模预估已从今年 2 月的 590 亿美元上调至 8 月的 2100 亿美元,约为此前预测值的 3.6 倍。与此同时,数据中心 AI 负载占比预计将从 2025 年的 40%提升至 2030 年的 80%。
英特尔首席营销与传播官 Annie Shea Weckesser 也强调,随着 AI 任务在规划、检索、推理和工具调用之间持续流转,CPU 的重要性正在提高。英特尔预计,数据中心 GPU 与 CPU 的配置比例将从约 4:1 逐步向接近 1:1 演进,并预测到 2030 年,全球超过 80%的服务器仍将采用 x86 架构。
288 核至强承接 Agent 负载,英特尔筹备新一代 CPU 机架
围绕 Agent 带来的计算需求,英特尔今年 6 月发布了采用 Intel 18A 制程的至强 6+处理器,最高提供 288 个内核,并推出相应的智能体套件。据英特尔介绍,单颗 288 核至强处理器可部署近 1000 个 Agent。
但在与国内软件合作伙伴和互联网企业进行测试后,英特尔发现,单颗 CPU 能够承载多少 Agent 并不是唯一指标。
“数量越多当然越好,但还不够,还需要性能足够强、智能体跑得足够快。”陈葆立表示,英特尔因此开始从两个维度衡量 Agent 性能:一是单颗 CPU 能够承载的 Agent 数量,二是每个 Agent 自身的执行性能。
根据英特尔披露的客户实测结果,在一组 SWE-bench 工作负载中,至强 6+的单 Agent 平均性能比对比平台高 15%。在沙箱启动测试中,在满足 200 毫秒启动时延 SLA 要求的条件下,至强 6+单颗处理器最多支持 350 个沙箱并发创建,约为某竞品的 1.46 倍。
针对 Agent 规模化部署,英特尔还在与国内 OEM、液冷等合作伙伴共同制定新的 CPU 机架方案,综合考虑 CPU 性能、网络、存储、散热和供电,以满足更高密度的 Agent 运行需求。相关产品计划后续推向市场。
除直接承载 Agent 外,英特尔还在强调至强作为 GPU 服务器主机 CPU 的作用。陈葆立指出,Agent 执行任务时需要处理网页、PDF、视频等不同类型的数据,这些内容必须经过预处理,才能交由大模型完成后续分析。英特尔正在利用至强内置加速器优化这些工作。在相关测试中,借助 AMX 等能力,向量化和重排序性能分别达到对比基准的 2 倍和 4 倍。
至强 6 系列也继续采用 P-core 和 E-core 两种路线。Annie Shea Weckesser 介绍,P-core 主要面向需要快速执行和响应的工作负载,E-core 则侧重提高 Agent 部署密度和能效,内置加速器还可承担安全、压缩、加密等任务,让 GPU 和其他加速器集中处理模型计算。
把数据存储与搬运纳入布局
随着长上下文和 Agent 应用增加,数据存储与搬运也成为英特尔的重点讨论方向。
从 HBM、系统 DRAM 到本地 SSD、远端存储,存储容量和成本逐层变化,但数据访问速度也随之下降。如何缩短数据访问路径、避免 CPU 和 GPU 等待数据,正在成为 AI 系统优化的重要环节。英特尔目前正通过 CXL、智能网卡和软件技术推进内存池化及远端存储加速。在中国市场,英特尔近期与焱融科技合作,基于至强 6 处理器和 MRDIMM 内存打造高性能存储系统。
KV Cache 则是英特尔进一步投入的方向。随着 AI Coding 和长上下文应用发展,推理过程中产生的 KV Cache 规模持续增加,单纯依靠 GPU HBM 越来越难以满足容量需求,部分缓存需要转移至系统内存或 SSD。
英特尔为此开发了 KV Cache 智能加速套件,利用至强内置加速器改善缓存压缩和数据搬运效率。其中,QAT 用于对 KV Cache 进行无损压缩,减少落盘所需容量;DSA 则用于提高数据搬运效率。根据英特尔披露的客户验证数据,整套 KV Cache 智能加速方案可将缓存传输速率最高提升 9.66 倍。
这一方向也与英特尔正在开发的新一代 GPU Crescent Island 相呼应。该产品采用 Xe3P 架构,面向 AI 推理和 Agentic AI 设计,使用 LPDDR5X 内存,最高容量达 480GB。按照规划,未来还包括 128GB 和 256GB 等不同容量配置。
陈葆立表示,英特尔也在持续投入配套软件,希望建立完整工具链,并及时适配主流开源大模型。在软件生态方面,英特尔继续参与 PyTorch、vLLM、SGLang 等开源项目,推动 AI 推理和 Agent 相关功能适配不同硬件平台。
从 AI PC 到物理 AI,18A 和先进封装支撑产品扩张
此外,英特尔还在继续扩大 PC、边缘和物理 AI 产品布局。
Annie Shea Weckesser 将当前战略归纳为三个方向:“首先,覆盖 PC、边缘和数据中心的开放计算平台;其次,围绕特定工作负载设计的定制化芯片;第三,在英特尔产品中实现日益复杂系统集成的制程与封装技术。”
在 PC 端,第三代酷睿 Ultra 处理器整合 CPU、GPU 和 NPU,能够根据任务需求选择不同计算引擎。英特尔表示,该平台支持在本地运行 350 亿参数级模型,并通过模型路由,在端侧计算和云端能力之间进行选择。目前,英特尔正与百度搭子、腾讯 Marvis、千问办公、TRAE、WorkBuddy 等推进混合 Agent 的软件优化和技能集成。
物理 AI 方面,英特尔希望将同一套异构计算能力延伸至机器人和其他边缘设备。节卡机器人正在基于酷睿 Ultra 处理器及 KVM 虚拟化技术,将实时运动控制、感知、自主规划和执行能力整合到统一的边缘计算架构中。
英特尔披露,目前已与 70 多家独立软件开发商合作推进 AI PC 体验,其中包括与中国 AI 模型提供商共同完成的 17 项首日适配发布;边缘侧则与 100 多家机器人公司开展合作。
定制化芯片也是其下一阶段重点。英特尔计划结合架构设计、IP、先进封装和晶圆制造能力,为超大规模云服务商等客户开发面向特定工作负载的 ASIC 及定制化方案。
制造方面,Intel 18A 已经进入量产阶段,高性能版本 18A-P 进入风险试产。Intel 14A 也在推进中,面向内部产品的风险试产计划于 2027 年下半年启动,目标是在 2028 年实现大规模量产爬坡。
先进封装方面,英特尔正在推进 EMIB、EMIB-T 等技术,将不同计算引擎和 IP 集成到单一封装中,以满足 AI 芯片对异构计算及高速互连的需求。