← 文章 / 行业与公司动态
NVIDIA 博客 18小时前 · 2026-09-06 01:35:17 · 4 阅读

火花四溅:NVIDIA 在 IFA 2026 加速本地 AI 部署

前沿智能正在走向本地化。在 IFA 2026 上,NVIDIA 携手 Microsoft 及众多合作伙伴,推出更快的推理速度和新工具,让 AI 智能体在 NVIDIA 硬件上更轻松地本地部署和运行。全新紧凑型 NVIDIA RTX Spark Windows PC 也将于 10 月上市,为 AI 爱好者、开发者和创作者提供更多以本地、安全方式运行强大智能体的选择。

本次发布的内容包括:

  • Hermes Agent、OpenClaw 和 Perplexity Portable Computer 即将简化对 NVIDIA GPU 的本地 AI 支持。
  • 本地推理速度最高提升 1.9 倍——全新的 llama.cpp 和 vLLM 优化现已直接可用,也可通过 LM Studio 和 Ollama 获取。
  • NVIDIA PAIR——一款个人 AI 路由工具,可将 AI 推理任务智能分发到用户本地网络中的多台 PC 上。
  • NVIDIA RTX Spark 将于 10 月登场——伴随联想和宏碁推出的全新 Windows PC。Electronic Arts、Embark 和 Ubisoft 等游戏发行商和开发商也已加入,将旗下大作带到 NVIDIA RTX Spark 平台。

此外,8 月对本地 AI 来说是忙碌的一个月:

  • Nemotron 3.5 Lightning——可在 NVIDIA RTX PC、RTX PRO 工作站、DGX Spark 和 Jetson 上运行——这款 300 亿参数模型现已发布。立即开始体验 Nemotron 3.5 Lightning
  • Z.ai 的 GLM-5.3-Flash 是一款多模态混合专家(MoE)模型,将智能体 AI 带入 DGX Station。
  • Qwen 发布了 Qwen3.8-Flash-Next,这是一款开放权重的多模态 MoE 模型,可在 DGX Spark 和 DGX Station 上本地运行;同时还推出了 Qwen3.8-27B,一款 270 亿参数的开放模型,针对 NVIDIA GPU 上的本地智能体和编程工作负载做了优化。
  • LTX 的 LTX 2.5 是一款开放世界视频生成模型,针对 NVIDIA RTX GPU、DGX Spark 和 DGX Station 优化,并通过全新的 NVFP4、FastVideo 和 ComfyUI 增强,实现更快、更省显存的本地生成。
  • MiniMax-H3 是一款开源权重视频生成模型,支持同步音频,可通过 ComfyUI 在 NVIDIA GPU 本地运行。FastVideo 与 NVIDIA 研究人员合作发布了 FastH3——一个开源权重的四步蒸馏版本,性能提升 7 倍。针对 NVIDIA RTX GPU 和 DGX Spark 的优化 FastVideo 配方即将推出。
  • Meta 的 Muse Glimmer 是一个拥有 300 亿参数的开源权重模型,适用于编码和智能体任务,可在 GeForce RTX PC、DGX Spark、DGX Station 和 Jetson 上本地运行。NVIDIA 还发布了支持 DGX Spark 的 NVFP4 量化,以实现更省显存的本地部署。
  • DeepSeek v4 Flash 是一个拥有 2840 亿参数(其中 130 亿激活参数)的 MoE 模型,可在 2x DGX Spark 集群和 DGX Station 上本地运行。

本地智能体的更简入门方式

要配置并运行基于本地模型的智能体,此前需要耗费不少精力——选择模型、寻找兼容的推理服务器、调整量化设置并保持一切更新。而在 RTX 和 DGX 系统上,这种摩擦正在消失。

三款最流行的智能体应用将在 Windows 上提供简化的本地模型设置体验,均基于 llama.cpp 构建并整合了 NVIDIA 最新的推理优化。新的设置体验旨在减少手动配置,让本地智能体更快跑起来。

上个月,Perplexity 推出了其 Portable Computer 智能体,为用户提供了一种在 NVIDIA DGX Spark 等 Linux 系统上本地运行 Perplexity 的简便方式,将模型、编排和工具打包为单一应用体验。

Perplexity Portable Computer 已在搭载 Linux 系统、显存至少 24GB 的 NVIDIA RTX GPU 上可用,Windows 支持即将上线,让更多 PC 用户也能享受这套简洁的使用体验。用户可在本地运行完整工作流,无需消耗积分;当任务需要额外的研究或推理时,可谨慎地升级至云端 15 多种前沿模型之一。在将内容发送至云端之前,Portable Computer 会征求用户许可,帮助用户将敏感信息保留在本地设备上。以下是几个示例用例:
  • 工程领域:审查关联 GitHub 仓库中的开放 PR,将其按「就绪」、「阻塞」、「过时」和「待审核」分类,并为每项标注下一步操作。针对那些与最新合并不同步的文档,系统会自动发现并修复,同时发起一个新的 PR。
  • 金融领域:将智能体指向两年内的经纪账户摘要、汇总的 1099 表格及报税表,让它追踪产生最多可避免费用和税务损耗的重复持仓,每处数据均精确引用至具体文件及页码——且文档全程不接触聊天机器人。
  • 初创公司:询问为何用户激活率持平,智能体会在本地分析漏斗导出数据,找出从安装到首次完成任务期间的流失点,然后将核心洞察直接发布到团队的 Slack 频道。

今天就试用 Portable Computer

Hermes Agent 由 Nous Research 开发,是一款深受数百万用户青睐的通用智能体,以高可靠性和自我进化能力著称。该智能体架构无关、提供商无关,专为在本地系统全天候运行而设计,使其与 RTX PC、RTX PRO 工作站及 DGX Spark 高度契合。

在 Hermes 中配置本地模型后,用户将在 Windows 系统的 RTX 和 DGX 设备上实现一键式设置。智能体会自动检测 NVIDIA GPU,选择合适的模型和配置,并通过内置的 llama.cpp(已集成 NVIDIA 推理优化)运行,免去手动下载模型和调整参数的麻烦。Linux 支持即将推出。

运行起来后,Hermes 的表现和其他平台上完全一致:调用工具、跨任务保持上下文、在会话间记住信息,并随着使用不断沉淀可复用的技能,让智能体越用越强。模型在本地 GPU 上运行,既保证了响应速度,数据也不出本机。

Windows 上现已支持一键部署本地模型,Linux 支持即将推出。了解更多关于 Hermes Agent 的信息。

OpenClaw 已成为开放智能体运动的标志性项目之一——它是 GitHub 上最大的 AI 项目,拥有超过 38 万 star,社区也在快速壮大,成员们围绕科研、工程、项目管理和日常效率打造各类工具与技能。

NVIDIA、Microsoft 和 OpenClaw 一直在合作,让 Windows PC 上的部署体验更简单。为降低上手门槛,OpenClaw Windows 应用简化了在任意配备至少 24GB 显存的 RTX GPU 上配置优化本地模型的流程。

更多信息请见 OpenClaw 博客。

更快的推理,为本地智能体提速

推理性能是本地智能体保持灵敏响应的关键。NVIDIA 将继续与开源 llama.cpp 和 vLLM 社区合作,加速各类 NVIDIA 本地平台上的智能体工作负载。

借助 GeForce RTX 5090 上的内核优化、改进的投机解码技术和更快的预填充,llama.cpp 的吞吐量最高提升 1.9 倍。

vLLM 在 RTX PRO 6000 Blackwell Workstation Edition 上提升 1.2 倍,在双 DGX Spark 集群上最高提升 1.4 倍。FlashInfer 中新增的 XQA attention 内核和后端优化,助力两个平台上的推理加速。

这些提升已在 llama.cpp 和 vLLM 推理后端上线。

用户也可以通过 LM Studio 和 Ollama 应用体验这些改进。

用 NVIDIA PAIR 盘活闲置 PC,扩充本地 AI 算力

美国超过半数家庭拥有两台及以上电脑,而这些算力在白天常常处于闲置状态。NVIDIA Personal AI Router (PAIR) 是一款免费开源软件工具,可将这些系统协同起来服务于本地 AI。

智能体工作流通常会将复杂任务拆分为可并行执行的小任务,但当每个请求都争抢同一块 GPU 时,性能可能会下降。PAIR 会自动发现本地网络中兼容的 PC,并将独立的推理请求路由至有空闲算力的设备。它支持 Ollama 和 LM Studio,并能在设备加入或离开网络时动态适配。

例如,用户可以要求 Hermes 通过梳理杂乱的收件箱、区分哪些需要立即处理、哪些可以暂缓、哪些可以跳过,来制定一份“周日重置”计划。Hermes 可以将该任务拆分给多个子智能体,而 PAIR 则把这些工作分发到多台可用 PC 上,避免全部挤在一块 GPU 上排队。

这样一来,本地智能体能获得更强的算力,支持更多任务并行,同时还能灵活地将 AI 工作负载转移到另一台 PC,即便主力机正用于游戏、创作或其他工作也不受影响。

NVIDIA PAIR 测试版已面向 Windows、macOS 和 Linux 推出,提供图形界面和终端两种操作方式,支持 NVIDIA GeForce RTX 20 系列及更新显卡、NVIDIA RTX PRO 工作站显卡(Turing 架构及更新)、NVIDIA DGX Spark 以及 Apple M4 或更新芯片。

请访问 NVIDIA 技术博客 开始使用 NVIDIA PAIR。

基于 RTX Spark 的 Cyberlink PhotoDirector AI PC 模式,实现强大的本地照片编辑

开源图像和视频模型让创作者得以在 PC 上尝试 Creative AI 模型。这让艺术家能够自由迭代、探索概念与创意,不再受限于令人焦虑的 Token 消耗,同时让创作内容更私密地保留在本地设备上。

CyberLink 全新 PhotoDirector AI PC Mode 是首批将扩散模型直接集成到创意软件中、并将其转化为艺术家手边创作工具的应用之一。该功能将登陆 PhotoDirector 365,并为 NVIDIA RTX Spark 专门优化。启用 AI PC Mode 后,用户将获得由 AI 驱动的各项编辑工具,包括生成式编辑、图像增强、物体与干扰项移除、背景移除与替换、肖像精修以及全新视觉内容生成——并根据任务需要灵活选择本地或云端处理。

在 NVIDIA GPU 上,PhotoDirector 借助 TensorRT-RTX 和 FP8 技术加速本地 AI 推理。

开始使用 Cyberlink 的 PhotoDirector 365 照片编辑软件,了解更多关于 PhotoDirector AI PC Mode 的信息,该功能将于十月随 RTX Spark 一同发布。

NVIDIA RTX Spark Windows 电脑将于 2026 年 10 月登场

NVIDIA RTX Spark 将在今年十月到来——而在 IFA 2026 上,合作伙伴纷纷展示其硬件方案。在展会上亮相的新设计将与现有的六家 OEM 厂商一同在十月出货。宏碁展示了其紧凑型台式 RTX Spark 概念机,联想则公布了 Yoga Pro 9n 和 Yoga 9n 二合一产品。

RTX Spark 标志着 Windows PC 的一个全新起点:一台专为创作者、游戏玩家和 AI 智能体打造的一体机。凭借强大的 1 Petaflop RTX Blackwell GPU、最高 128GB 统一内存以及高效能 20 核 Grace CPU,RTX Spark 提供令人惊叹的性能与能效。这款超级芯片使得高性能轻薄笔记本拥有全天续航,同时让紧凑型台式机为全天候在线的智能体提供动力。配合全新的 Windows Agent 框架,它支持智能体在操作系统层面管控下安全地在后台运行。

上周在 Gamescom 展会上,艺电、Embark 和育碧成为最新一批将大作搬上 NVIDIA RTX Spark Windows PC 的游戏发行商与开发商。他们加入了在今年五月 COMPUTEX 上宣布支持 RTX Spark 的发行商行列,其中包括 KRAFTON、网易、Riot Games 和 XBOX。阅读更多

立即注册,以便在 RTX Spark 笔记本和台式机上市时收到通知。

#ICYMI:NVIDIA Local AI 更多动态

🎮 NVIDIA 携全新 RTX 技术和游戏亮相 Gamescom — NVIDIA 发布了 DLSS 4.5 Ray Reconstruction,采用全新第二代 Transformer 模型,提升光线追踪和路径追踪游戏的画质。Gamescom 上还针对 007 First Light、CONTROL Resonant 和 Gears of War: E-Day 等游戏发布了全新 RTX 消息,并宣布即将推出的 NVIDIA RTX Spark 将扩展更多游戏支持。

🐋 DeepSeek Harness 问世 — DeepSeek 全新开源 harness 搭配 DeepSeek-V4-Flash,可在 NVIDIA DGX Station 和多台 DGX Spark 组合上驱动本地智能体编码工作流。

📊 MLPerf Client v2.0 拓展 AI PC 基准测试 — MLCommons 与 NVIDIA 及其他行业领军企业合作,发布了 MLPerf Client v2.0。此次更新新增智能体 AI 和图像生成基准测试,并扩展了 LLM 测试范围,覆盖真实的本地 AI 工作负载。

XInstagramTikTokFacebook 上关注 NVIDIA RTX Spark,并订阅 NVIDIA Local AI 新闻通讯获取最新资讯。也可在 LinkedIn X 上关注 NVIDIA Workstation。

软件产品信息详见相关说明

原始来源: NVIDIA 博客

评论 (0)