← 文章 / 芯片硬件
NVIDIA 开发者博客 6小时前 · 2026-09-12 08:14:56 · 3 阅读

从晶圆出片到首个 Token:利用 Nemotron 与 Palantir Foundry 将供应链专业知识代码化

NVIDIA 拥有全球规模最大、最复杂的供应链之一,其绩效从晶圆出片一直追踪到首个 Token 生成。这一过程分为两个阶段:Time-to-rack(上架时间)涵盖从硅片离开晶圆厂,到组装完成的系统抵达数据中心机房;Time-to-token(Token 生成时间)则包含此后的一切环节:供电、冷却、网络,以及让基础设施在第一天就能投入生产的软件栈。

NVIDIA Grace Blackwell NVL72 平台使用了数百万个零部件,供应商遍布全球,最终系统由数十家 OEM 和 ODM 负责组装。仅一个计算托盘——单台机架中的 18 个之一——就需要 2 颗 NVIDIA Grace CPU、4 颗 NVIDIA Blackwell GPU 和 32 组 HBM3e 内存堆栈。我们为 Vera Rubin 打造的供应链规模是 Grace Blackwell 的两倍。CPU、GPU 和内存都是关键组件,且其库存状况每周都在变化,因此本周卡住生产的零部件,下周可能就供应充足。每个组件都有其独立的物料清单、供应商和交期。将这些因素乘以期机架内的每个子装配体,结果看起来就不像供应链,而更像一道令人望而生畏的组合数学题。

在来自三个来源池的所有组件到齐之前,合同制造商无法开始组装:NVIDIA 直供件、NVIDIA 寄售库存件,以及供应商直供件。理想情况下,所有组件同时到达,但现实往往是早到的部件不得不等待迟到的部分。NVIDIA 从制造站点收到物料的那一刻起就开始计时,直到物料作为子装配体或成品离开站点,这一指标被称为 Time of Ownership(TOO,所有权周期时间)。

面对高度动态的库存状况,NVIDIA 必须决定向每个制造站点分配什么物料以及分配多少。这就是关键物料分配问题,每周都需要人工重新调整。分配计划覆盖当前季度和下一个季度,最近几周的需求已经锁定,因此每周的新数据主要影响的是更远期安排。

本文主要关注 Time-to-rack,压缩它需要做到四件事:

  • 实时可视化,随时定位关键运营瓶颈
  • 冗余备份,避免单点故障导致生产停摆
  • 高可靠性,确保上游生产承诺得以兑现
  • 将人类专家经验代码化,让复杂分配决策背后的判断沉淀为可持续积累的知识资产

前三项要求提供了必要的运营基础,而人类专家经验的代码化才是带来最大变革的关键。

GB200 NVL72 计算托盘的分解视图,展示其内部电路板和处理器模块在开放式机架机箱上方的排布。
图 1. GB200 NVL72 计算托盘需要两个 Grace CPU、四个 Blackwell GPU 和三十二个 HBM3e 堆栈,这些都是供应动态变化的关键组件

在 Palantir Foundry 中构建供应链指挥中心

NVIDIA 供应链运营团队与 Palantir 合作,为物料分配决策的每一项输入建立了统一视图。NVIDIA 团队称之为数字供应链智能(Digital Supply Chain Intelligence)指挥中心,它能呈现各种风险、阻塞点及其他信号——这些信号影响着决策,但过去往往分散在互不联通的数据源中,难以被发现。

视频 1. 面向计算供应链的主权 AI

在底层,Palantir Foundry 提供了运营上下文。其 Ontology 将物料、制造基地、产能承诺、产能、分配、生产产出以及非结构化的定性信号统一到同一个受治理的数据层。它由对象和关联而非行与表构成,完整刻画了运营的真实状态。

有了这种表征,分配规划人员就能模拟和分析各种不同的场景,大幅拓宽可探索的决策空间,也为 AI 飞轮奠定基础——让新知识不断积累,性能随时间持续提升。

Palantir Foundry 供应链仪表盘,显示 842,190 个受限单元、128 万个范围内库存单元以及 260 个受保护的高优先级单元。世界地图追踪实时供应流动和受限站点,相邻面板显示决策队列、运营知识、52 周履约趋势,以及产能、运输、良率和承诺风险的热点图。
图 2. NVIDIA 供应链在 Palantir Foundry 中的统一运营视图

利用 NVIDIA cuOpt 解决量化问题

跨多个制造厂分配物料,本质上是一个量化问题。建模始于决策变量:在接下来的一段时间内,每种受限物料应分配给哪些工厂、各分配多少?围绕这些变量的是一系列边界条件。这包括所有能够生产特定 Blackwell 子总成的制造商,以及物料到位后每个站点能吸纳的吞吐量。还包括每个必需部件的依赖关系图,沿链条逆向映射,让求解器明白:阻碍计算托盘生产的,是其最稀缺的输入,而非平均水平。这一关键约束并非固定不变,而是在以下因素间动态波动:

  • GPU、CPU 和内存的供需随周变化
  • 三条供应路线的进货时间窗口
  • 已对客户做出的承诺,这决定了任何单一站点短缺的实际成本
  • 成千上万个变量和约束最终收敛为单一的周度分配方案。

NVIDIA cuOpt 是一个面向 GPU 加速决策优化的开源库,负责解决这一问题。它从本体(Ontology)读取输入,并将结果写回作为分配决策。分配被建模为一个混合整数线性规划问题,目标是最小化持有时间(TOO)。cuOpt 返回的不仅仅是分配方案,它还报告哪些约束是紧约束(binding),让规划者看清:是台湾的产能而非内存供应,压制了本周的产量。

由于求解速度极快,规划者还能探索答案周围的解空间。如果本期内存减少 10% 会发生什么?如果一个新的制造厂投产呢?规划者不再只是向求解器索取一个答案,而是开始询问其背后的权衡取舍。

数学的边界

量化的最优解并非全貌。NVIDIA 和 Palantir 用实际发生的事件回溯历史分配决策,结果发现 cuOpt 未能捕捉到关键的人为因素。 规划者掌握着求解器看不到的信息:那一周与伙伴往来邮件、关键区域的极端天气预警、正在发生的地缘政治事件、上一次供应商复盘会议的记录,以及多年积累的经验。这些信息塑造了对下个周期如何分配物资的直觉,正是这种直觉让人类专家超越了纯数学计算。 基于此,NVIDIA 和 Palantir 围绕这些人类专家构建了工作流程。它捕捉分配决策、决策背后的逻辑、预期结果和实际结果。一旦机构知识被转化为明确且可审查的决策逻辑,并存储在 Ontology 中,它就为训练 LLM 学习专家判断奠定了基础。

将决策智能编码化

接着,我们对一个开放权重 LLM 进行后训练,使其应用同样的推理逻辑并给出建议。在评估 NVIDIA Nemotron 的开源模型后,我们选择了 Nemotron 3.5 Lightning,因为它专为代理工作流的执行层设计。作为模型系统的一部分,它负责执行特定任务,而系统中包含更大规模的模型用于编排和通用任务。 其混合专家架构适合高效推理。该模型体量轻盈,总参数 300 亿,每次前向传播激活约 30 亿参数,但足以学习专注的策略。这种轻量级特性使后训练循环具有可行性:相较于更大的模型,小模型学习更快,训练和部署所需的算力也大幅减少。

Nemotron 是开放的,可以在你自己的算力边界内进行后训练。任何组织都能在自己的运营数据上跑通同样的飞轮,而无需将数据暴露给外部。模型学习的信号正是规划人员实际使用的那些:给制造工厂分配了多少受限物料、厂商承诺生产多少、最终实际生产多少,以及决策时可以获得的定性运营证据。

目标是沉淀出一套分配策略,能够评估生产风险、给出建议的分配区间、指出建议背后的关键因素,并向供应链团队解释其推理过程。

每条记录同时也是评估工具。我们只基于当天可知的信息重放每个决策,隐藏实际结果,然后把模型的建议与规划人员的判断以及实际发生的情况做对比。这项评估要回答的核心问题是:如果这个模型上个月就在运行,它能否做出正确的分配决策?

从 Ontology 数据到专用模型

训练流程从 Palantir Ontology 中的运营历史数据开始:

  • 匿名化:NeMo Anonymizer 在训练前去除个人身份信息,并对敏感字段做混淆处理。
  • 合成数据生成:NeMo Data Designer 对样本进行扩充和均衡,让模型不只看到常规的周度情况,还能接触到分配上调、产能受限和供应中断等场景。
  • 监督微调:NeMo AutoModel 在基础权重保持冻结的前提下训练一小组 LoRA adapter 参数,从而缩短训练时间、降低内存需求并减小 checkpoint 体积。
  • 评估:时点回测(point-in-time backtest)将相同的历史决策分别输入基础模型和微调后的模型,从而量化后训练带来的提升。

Palantir Autopilot 端到端管理整个生命周期:从 Ontology 数据启动每个任务、监控部署的自定义 Nemotron 模型,并保持从数据、模型版本到建议输出的完整血缘关系。

部署后,模型会读取当前的运营上下文,并返回包含建议理由及关联风险的建议。规划人员会审查这些建议,并做出最终决定。

Palantir Foundry 架构展示了决策循环,其中来自 Palantir Ontology 的受治理数据流经 NVIDIA cuOpt 和自定义的 Nemotron 3.5 Lightning 模型,传递给人类分配规划人员,其输入反馈到本体中。Palantir Autopilot 训练流水线对数据进行匿名化和扩展,训练模型,并在返回决策循环之前运行时点回测。
图 3。分配决策和模型训练共享同一个受治理的数据层。规划人员的决策成为训练数据,时点回测作为每次部署的关卡。

闭环

每一次接受、编辑、覆盖和生产结果都会写回 Ontology,不断积累,直到拥有足够多的代表性数据,以证明再次进行受治理的训练运行是合理的。

未来,这种反馈将用于强化学习。被接受和被覆盖的建议将形成偏好对,奖励涵盖分配的准确性、策略合规性和证据基础。模型不会在生产环境中自我重新训练。

这种结果在两个方面产生了复利效应:规划人员花费更少的时间重构常规决策,从而覆盖更多的站点和产品;分配专业知识也变成了机构知识,缩短了入职时间,并在整个组织中传播关键经验。

后训练带来的成果

NVIDIA 供应链运营团队与 Palantir 合作,指定模型接收什么内容、可以推荐什么,以及如何对这些推荐进行评分。该工作流既成为了应用程序,也成为了分配决策智能的基准测试。

我们在相同的任务和相同的评估数据上比较了三种模型:

  • 基础版 Nemotron 3.5 Lightning (BF16)
  • Nemotron 3 Ultra (NVFP4)
  • 我们后训练的 Nemotron 3.5 Lightning (BF16)

在开发基准测试中,经过后训练的 Lightning 模型达到了86.7% 的分配决策准确率。Ultra 模型为 55.5%,基础版 Lightning 仅为 17.5%。这意味着后训练模型比 Ultra 高出 31.2 个百分点,比自身基础模型高出 69.2 个百分点。

比较三种模型在分配建议上的表现的柱状图。微调后的 Nemotron 3.5 Lightning 表现最佳,准确率为 86.7%,平衡准确率为 58.6%,Macro-F1 为 57.5%。Nemotron 3 Ultra 分别为 55.5%、42.0% 和 39.5%;基础版 Nemotron 3.5 Lightning 分别为 17.5%、29.0% 和 13.5%。
图 4. 后训练 Nemotron Lightning 与 Nemotron Ultra 的准确率对比

在两项均衡评估决策类型而非样本数量的指标上,它也占据领先。平衡准确率取各分类召回率的平均值,因此稀有事件与常见事件权重相同:

Lightning 的平衡准确率为 58.6%,而 Ultra 为 42.0%。Macro-F1 取各分类 F1 值的平均值,并纳入精确率,防止模型通过过度预测稀有类别来虚增召回率:Lightning 为 57.5%,Ultra 为 39.5%。这两项指标至关重要,因为在供应受限的情况下,规划者削减分配的频率远高于增加,若仅看整体准确率,会高估盲目预测多数类模型的性能。

这一结论具体且重要:

在有限的分配任务中,专用的 30B 模型可以超越规模大出一个数量级以上的通用模型。

这并不意味着小模型在综合能力上更强。其优势集中体现在其后训练所覆盖的领域。尽管经过微调,未来的生产风险预测依然困难。专业化提升了决策任务的表现,但未能解决所有相关的预测问题。

LoRA 运行在 2 块 NVIDIA B200 GPU 上几分钟内即完成,资源消耗极低,便于随着反馈积累反复迭代。这是主权 AI 的实际体现:专有供应链数据、模型权重和推理过程均保留在单一受管环境中。该 AI 栈可部署在本地或云端,使组织能在数据、系统和运营需求所要求的地方运行 AI。

会学习的供应链

本文讨论的供应链工作流并非半导体行业独有。任何由经验丰富的人员根据零散信息分配关键产能的业务,都可以运行同样的飞轮,并将其适配到新的领域。

这需要三个关键要素:

  • 一个受管控的运营层
  • 同时记录决策依据和结果的决策捕获机制
  • 一个可以在自己的安全算力边界内进行后训练的开放模型

运营数据训练模型,模型改进决策,决策又成为下一轮受管控训练的新运营数据。NVIDIA 和 Palantir 正是以这种方式缩短从晶圆出货到首个 token 的产出时间,也正因如此,全球最可靠的 AI 基础设施供应链的学习速度才能超过其增长速度。

立即上手,为你的 agentic 工作流定制高效的开放权重模型。

订阅 NVIDIA 新闻,并在 LinkedInXYouTube 以及 DiscordNemotron 频道上关注 NVIDIA AI,及时了解 NVIDIA Nemotron 的最新动态。

Hugging Face 上获取开放的 Nemotron 模型,并在 build.nvidia.com 上查看 NIM 微服务和开发者示例合集。

原始来源: NVIDIA 开发者博客

评论 (0)