NVIDIA 与 CoreWeave 打造 Agentic AI 生产闭环:Cognition 首发 Vera Rubin NVL72 提升 4.8 倍吞吐量
基于近十年的联合工程经验,CoreWeave 将 NVIDIA 的计算、网络和软件能力整合,打造了一个专为 AI 设计的云平台,并且该架构在多代部署中持续保持投资回报率。如今,CoreWeave 正将下一代 NVIDIA 基础设施推向生产环境。
在本周于旧金山举行的 CoreWeave Fully Connected 大会上,CoreWeave 宣布推出配备 Spectrum-X 102.4T 以太网网络的 NVIDIA Vera Rubin NVL72 系统。Cognition——即 Devin AI 软件工程师背后的应用 AI 实验室——是首家在 Vera Rubin 上运行生产工作负载的客户。
CoreWeave 还将提供 NVIDIA Vera,这是首款专为 AI 代理设计的 CPU。此外,CoreWeave 推出了 CoreWeave Forge,这是一个基于 NVIDIA 加速计算的环境,用于训练、评估和改进模型及 AI 代理。
“NVIDIA 加速计算在多代产品中均能创造价值,”NVIDIA 超大规模及高性能计算副总裁 Ian Buck 表示,“早在 Volta 推出近十年后,CoreWeave 上的 NVIDIA V100 GPU 仍在运行客户工作负载,与此同时,CoreWeave 已将 Vera Rubin NVL72 投入生产。这正是 NVIDIA 平台的优势所在:基础设施能在多年内持续产生收益,并具备将合适 GPU 部署到合适工作负载的灵活性。”
Cognition 在 Vera Rubin NVL72 上实现 4.8 倍 Token 吞吐量提升
Cognition 在 CoreWeave 上运行 Devin 的训练、强化学习和生产推理任务。该公司在九个月内将 CoreWeave 上的 GPU 扩展至数千个,以支撑 Cognition 的推理工作负载。
本月早些时候,CoreWeave 收到了首批 Vera Rubin NVL72 生产机架。随后,Cognition 使用真实的软件工程工作负载,对 Vera Rubin 的推理性能进行了基准测试,并以 GB200 NVL72 作为基线进行对比。为生成这一工作负载,他们从 FrontierCode 中采样了一组任务,并部署 AI 代理来解决这些问题。
在早期测试中,Cognition 发现与 GB200 NVL72 相比,Vera Rubin NVL72 在 SWE-2 推理工作负载上的总 Token 吞吐量最高提升了 4.8 倍。对于 Devin 而言,这些提升意味着更快的实时代码生成和更敏捷的多步推理能力。
“智能体编码是一项复杂负载:长上下文、高并发以及巨大的 Token 吞吐量,每 Token 的成本决定了我们能发布什么产品,”Cognition 创始团队成员 Silas Alberti 说道。“将所有组件整合到一个平台上,并有 NVIDIA 和 CoreWeave 的工程师与我们并肩攻克难题,这比任何单一规格参数都更重要。”
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin
CoreWeave 宣布 CoreWeave Cloud 现已支持 NVIDIA Vera Rubin NVL72,使其成为首批让客户用上该平台的服务商之一。
早期访问客户可以快速在 CoreWeave Cloud 上利用 NVIDIA 全栈 AI 工厂平台的性能。在短短几天内,CoreWeave 便为 Cognition 搭建了一个生产级的 Vera Rubin 集群。这一成果源于 NVIDIA 与 CoreWeave 在从基础设施到服务 Token 的整个技术栈上的协同设计与合作。
用户可通过 CoreWeave Kubernetes Service (SUNK)、CoreWeave Mission Control、CoreWeave Sandboxes 和 CoreWeave Inference 来管理算力资源。
NVIDIA Vera CPU 即将登陆 CoreWeave Cloud,测试显示智能体沙箱启动速度提升 3 倍以上
智能体 AI 从两个方向对基础设施施压:服务智能体需要大规模的低延迟计算,而通过后置训练提升智能体则需要同时运行数千个隔离环境。
NVIDIA Vera CPU 专为智能体工作负载设计。对于智能体 AI 而言,关键性能指标之一是能同时运行多少个隔离的智能体环境,以及随着数量增加,每个环境的性能是否保持一致和高。
CoreWeave 部署的 Vera 系统将 128 颗 CPU 和 11,264 个核心集成在单个机架中,足以支撑每个环境分配一个核心时的 11,000 多个并发环境。借助 CoreWeave Sandboxes,这些环境拥有硬件级隔离,并与它们支持的训练任务并行运行。Spectrum-X 以太网交换机和 BlueField-4 DPU 确保了低延迟、安全且高性能的智能体通信。
在测试中,CoreWeave 在 NVIDIA Vera CPU 上实现了 3 倍以上的智能体沙箱启动速度提升,加速并扩展了其沙箱能力——这是强化学习 (RL)、智能体工具调用和模型评估的执行层,让 AI 团队能在 CoreWeave 上的隔离环境中运行代码。在 Terminal-Bench 基准测试中,Vera CPU 在所有通过的任务上实现了 1.7 倍的性能提升。
CoreWeave Forge:打通从生产回溯到训练的 AI 闭环
模型和智能体的进步靠的是一个循环:生产行为反馈给下一轮训练,每次评估让下一个版本更精准。过去,这个循环被拆散在不同厂商的工具之间,信号在每次交接时都会丢失。
CoreWeave Forge 将 Weights & Biases、OpenPipe 的后训练专长,以及开源的 marimo notebook 项目整合到一个互联环境中,专为模型和智能体的持续优化而打造,并在模型、框架和云平台之间保持开放。
新增和扩展的能力包括:
- CoreWeave ARIA(现已正式发布)帮助用户在整个 AI 循环中学习、研究、编写代码并快速迭代:分析运行结果、提出实验方案、推荐代码改动并存入 GitHub,还能带回可落地的分析——解析实验数据、找出变化背后的原因,并建议下一批要跑的实验。
- CoreWeave Agent Lens 是一项新服务,它把生产环境的智能体可观测性转化为持续改进和易于理解的洞察,将故障检出率提升 20%,修复成本减半,把数千万条生产环境的智能体追踪记录变成推动修复的洞察。
- CoreWeave Sandboxes(现已正式发布)让用户在隔离的 CPU 或 GPU 执行环境中运行智能体、工具调用、RL 和评估,既可以用 serverless 基础设施,也可以用自己已有的训练基础设施,为每一次智能体工具调用、RL 运行或评估都提供全新且隔离的环境。
- 后训练能力利用用户自己的生产信号来提升模型质量、降低延迟和成本,无需专门的训练集群。Serverless 监督微调和 serverless RL 让用户可以自由试验自己的训练配方。与自建方案相比,Serverless RL 训练速度快 1.4 倍,成本低 40%。
面向 AI 工厂的开源推理框架 NVIDIA Dynamo 为 CoreWeave 的托管推理服务及 RL Rollouts 提供动力,后者目前处于私有预览阶段。RL Rollouts 能在部署运行期间动态加载新的检查点,使强化学习无需重新部署即可持续进行,同时让后训练过程获得与生产环境同等高效的推理性能。
Canva、Capital One 和 MasterClass 是首批基于 Forge 构建应用的代表公司。
NVIDIA Nemotron 开源模型为 Forge 上的团队提供了一条直接路径,用于定制和部署适用于智能体工作流的推理及多模态模型。
从初创到全球企业的卓越成效
AI 实验室、AI 原生企业及全球大型公司正借助 NVIDIA 与 CoreWeave 联合设计的平台,加速从原型阶段迈向生产环境。
在医疗健康领域,Ennoble Care 是一家面向 15 个州约 5 万名高需求 Medicare 患者提供居家护理服务的机构,已选择 CoreWeave 来运行临床 AI 推理。该公司将在 CoreWeave Kubernetes 服务上使用预留的 NVIDIA RTX PRO 6000 GPU 资源,以扩展用于临床文档记录、决策支持及后台办公自动化的 AI 智能体。
CoreWeave 在多轮训练与推理中均取得了创纪录的 MLPerf 结果。它是唯一在 SemiAnalysis ClusterMAX 1.0、2.0 和 3.0 版本中均获得白金级排名的云服务商,并服务于前十大 AI 实验室中的九家。
NVIDIA 与 CoreWeave 合力向客户提供了一个平台,将实验性智能体转化为生产级系统,使其能够编写软件、辅助临床医生并在现实世界中执行实用工作。
通过参加 CoreWeave Fully Connected 大会上的 NVIDIA 专场、演示及研讨会,了解更多信息。