Nvidia Nemotron 3.5 Lightning与NeMo Switchyard:开源模型赋能智能体时代
随着人工智能从聊天机器人向自主智能体转变,开源模型正满足市场对AI运行位置、部署方式及演进路径全面掌控的需求。
今日,NVIDIA扩展其Nemotron 3模型家族,推出Nemotron 3.5 Lightning——同类中面向长时运行智能体工作负载的最高效模型。该版本紧随Nemotron 3 Nano之后发布,体现了NVIDIA持续改进开源模型以提升准确性与速度的承诺。
Nemotron 3.5 Lightning专为大型多智能体系统中的特定任务而设计,是一个拥有300亿参数的混合专家模型,助力打造更智能、更高效的智能体应用。
此外,NVIDIA还发布了NeMo Switchyard——一个开源库,用于在主流智能体工具中实现智能路由。企业可根据自身需求构建路由器。部署后,NeMo Switchyard能智能地将每个请求导向最适合该任务的模型,涵盖开发者自有的开源、专有及NVIDIA模型组合,且无需开发者重写应用。
Nemotron 3.5 Lightning与NeMo Switchyard共同赋予用户对AI部署方式、运行位置及运行效率的更强掌控力——无论是PC、工作站、数据中心还是云端。

常驻智能体需要模型系统
现代智能体系统——即常驻智能体——日益以模型系统或模型集成的方式运作,不同模型专精于不同任务。
NVIDIA Nemotron开源模型正是为此架构而设计。像Nemotron 3 Ultra或GPT-5.6这样的前沿推理模型可规划并编排工作流,而Nemotron 3.5 Lightning等更小的专用模型则能执行代码审查、工具调用、安全警报监控及账单查询等针对性任务。
以Nemotron 3.5 Lightning驱动高吞吐专用任务
NVIDIA Nemotron 3.5 Lightning 是一款完全可定制的开放模型,专为支撑常驻智能体的高吞吐任务而设计。该模型由 Nemotron Coalition 贡献开发,其成员提供了评估方法、推理软件和数据集,助力模型持续演进。
该模型的输出速度最高提升 4 倍,与同类模型相比,智能体任务完成速度加快 30%。同时,由于模型开放且可定制,Nemotron 3.5 Lightning 可借助 NVIDIA NeMo 轻松基于企业自身的领域数据、工具和工作流进行后训练,从而提升专业任务的准确性。

各行业 AI 领军企业正针对自身工作负载定制 Nemotron 3.5 Lightning,包括 CrowdStrike 用于网络安全、Harvey 与 Trajectory 合作用于法律服务,以及 CodeRabbit 与 Baseten 合作用于代码审查,这些应用显著提升了特定领域智能体任务的准确性。此外,Lila Sciences 正借助该模型提升物理和生命科学领域智能体任务的推理能力,而 Fastino Labs 则通过定制该模型,在软件开发、金融和医疗健康工作负载上取得了领先的准确性表现。

Nemotron 3.5 Lightning 还让组织能够掌控隐私和部署方式。它可以在本地 AI 系统上运行——包括 NVIDIA RTX 个人电脑、NVIDIA DGX Spark、NVIDIA DGX Station 和 NVIDIA Jetson——帮助用户最大化现有基础设施投资,或扩展到边缘 AI 设备、NVIDIA RTX PRO 工作站、数据中心和云环境,以满足企业级应用需求。此外,Nemotron 3.5 Lightning 还能在本地或本地部署环境中运行,适用于需要快速响应的高吞吐量、专业化任务。
同时,与每次 Nemotron 发布一样,NVIDIA 会在许可允许的范围内公开尽可能多的训练数据和技术细节,从而实现可追溯性、审计性,并支持其他模型的训练。伴随 Lightning 的发布,NVIDIA 还推出了 Nemotron-RL-Agentic-Terminal-Pivot,这是一个用于后训练编码智能体能力的强化学习数据集。
通过模型路由实现更高效的 AI 应用
有些模型擅长编码,有些擅长推理,有些适合轻量级任务,还有些则针对本地运行进行了优化,以提升隐私性和效率。如果客户依赖单一默认模型,可能会面临成本超支或质量下降的问题;而如果手动管理路由,则可能因集成工作拖慢部署进度。
NVIDIA NeMo Switchyard 是一个面向 AI 智能体的开源模型路由库。该技术可根据具体需求,自动将提示词路由到每个智能体工作流步骤中最强大、最高效的模型。智能体应用开发者可以通过不同的路由算法调整或修改路由器,以匹配其优先级,如质量、延迟和成本要求。在模型系统中,企业可以构建强大的 AI 智能体,并优化代币经济性。
内部基准测试显示,NeMo Switchyard 在保持前沿级准确性的同时,将任务完成成本降低至仅使用 Opus 4.8 时的近三分之一。

NVIDIA 正在与 AI 生态系统中的合作伙伴携手,将智能模型路由引入开发者已使用的工具和平台。
- Boomi:在五项路由能力上评估了 Switchyard,实现了 100% 的领域路由准确性,将 59% 的流量发送至一个快 5 倍的微调模型,并将后续轮次延迟降低了 21%。
- Cadence:通过使用 ChipStack AI Super Agent 进行形式验证用例,效率提升了 9.9%。
- Classmethod:在内部使用 NeMo Switchyard 运行 opencode 和 Fireworks 工作负载,初步测试显示成本降低了 27%,同时保持了质量。
- Cognition:已将 NVIDIA NeMo Switchyard 分阶段路由器集成到 Devin Desktop 中供 NVIDIA 内部使用,在 FrontierCode Main 上实现了接近前沿的性能,同时与将所有请求路由至单一底层前沿模型相比,平均成本降低了 28%。
Nemotron 3.5 Lightning现已通过Hugging Face、ModelScope、OpenRouter及build.nvidia.com提供,以NVIDIA NIM微服务形式发布,并可通过NVIDIA云合作伙伴、后训练平台、推理平台及云服务提供商的广泛生态系统获取。NeMo Switchyard已在GitHub上开放,并即将登陆合作伙伴平台。