← 文章 / AI技术
Hacker News 6小时前 · 2026-08-12 15:24:22 · 2 阅读

Nvidia Nemotron 3.5 Lightning与NeMo Switchyard:开源模型赋能智能体时代

随着人工智能从聊天机器人向自主智能体转变,开源模型正满足市场对AI运行位置、部署方式及演进路径全面掌控的需求。

今日,NVIDIA扩展其Nemotron 3模型家族,推出Nemotron 3.5 Lightning——同类中面向长时运行智能体工作负载的最高效模型。该版本紧随Nemotron 3 Nano之后发布,体现了NVIDIA持续改进开源模型以提升准确性与速度的承诺。

Nemotron 3.5 Lightning专为大型多智能体系统中的特定任务而设计,是一个拥有300亿参数的混合专家模型,助力打造更智能、更高效的智能体应用。

此外,NVIDIA还发布了NeMo Switchyard——一个开源库,用于在主流智能体工具中实现智能路由。企业可根据自身需求构建路由器。部署后,NeMo Switchyard能智能地将每个请求导向最适合该任务的模型,涵盖开发者自有的开源、专有及NVIDIA模型组合,且无需开发者重写应用。

Nemotron 3.5 Lightning与NeMo Switchyard共同赋予用户对AI部署方式、运行位置及运行效率的更强掌控力——无论是PC、工作站、数据中心还是云端。

Nemotron 3.5 Lightning以小巧、可定制的开源模型提供前沿级智能,专为高吞吐智能体工作流打造。

常驻智能体需要模型系统

现代智能体系统——即常驻智能体——日益以模型系统或模型集成的方式运作,不同模型专精于不同任务。

NVIDIA Nemotron开源模型正是为此架构而设计。像Nemotron 3 Ultra或GPT-5.6这样的前沿推理模型可规划并编排工作流,而Nemotron 3.5 Lightning等更小的专用模型则能执行代码审查、工具调用、安全警报监控及账单查询等针对性任务。

以Nemotron 3.5 Lightning驱动高吞吐专用任务

NVIDIA Nemotron 3.5 Lightning 是一款完全可定制的开放模型,专为支撑常驻智能体的高吞吐任务而设计。该模型由 Nemotron Coalition 贡献开发,其成员提供了评估方法、推理软件和数据集,助力模型持续演进。

该模型的输出速度最高提升 4 倍,与同类模型相比,智能体任务完成速度加快 30%。同时,由于模型开放且可定制,Nemotron 3.5 Lightning 可借助 NVIDIA NeMo 轻松基于企业自身的领域数据、工具和工作流进行后训练,从而提升专业任务的准确性。

PinchBench 基准测试显示,Nemotron 3.5 Lightning 在同类模型中实现了更快的智能体任务完成速度,同时保持了前沿水平的准确性。

各行业 AI 领军企业正针对自身工作负载定制 Nemotron 3.5 Lightning,包括 CrowdStrike 用于网络安全、Harvey 与 Trajectory 合作用于法律服务,以及 CodeRabbit 与 Baseten 合作用于代码审查,这些应用显著提升了特定领域智能体任务的准确性。此外,Lila Sciences 正借助该模型提升物理和生命科学领域智能体任务的推理能力,而 Fastino Labs 则通过定制该模型,在软件开发、金融和医疗健康工作负载上取得了领先的准确性表现。

企业已定制 Nemotron 3.5 Lightning,以在其智能体工作流中实现针对特定任务的高精度表现。

Nemotron 3.5 Lightning 还让组织能够掌控隐私和部署方式。它可以在本地 AI 系统上运行——包括 NVIDIA RTX 个人电脑NVIDIA DGX SparkNVIDIA DGX StationNVIDIA Jetson——帮助用户最大化现有基础设施投资,或扩展到边缘 AI 设备、NVIDIA RTX PRO 工作站、数据中心和云环境,以满足企业级应用需求。此外,Nemotron 3.5 Lightning 还能在本地或本地部署环境中运行,适用于需要快速响应的高吞吐量、专业化任务。

同时,与每次 Nemotron 发布一样,NVIDIA 会在许可允许的范围内公开尽可能多的训练数据和技术细节,从而实现可追溯性、审计性,并支持其他模型的训练。伴随 Lightning 的发布,NVIDIA 还推出了 Nemotron-RL-Agentic-Terminal-Pivot,这是一个用于后训练编码智能体能力的强化学习数据集。

通过模型路由实现更高效的 AI 应用

有些模型擅长编码,有些擅长推理,有些适合轻量级任务,还有些则针对本地运行进行了优化,以提升隐私性和效率。如果客户依赖单一默认模型,可能会面临成本超支或质量下降的问题;而如果手动管理路由,则可能因集成工作拖慢部署进度。

NVIDIA NeMo Switchyard 是一个面向 AI 智能体的开源模型路由库。该技术可根据具体需求,自动将提示词路由到每个智能体工作流步骤中最强大、最高效的模型。智能体应用开发者可以通过不同的路由算法调整或修改路由器,以匹配其优先级,如质量、延迟和成本要求。在模型系统中,企业可以构建强大的 AI 智能体,并优化代币经济性。

内部基准测试显示,NeMo Switchyard 在保持前沿级准确性的同时,将任务完成成本降低至仅使用 Opus 4.8 时的近三分之一。

NVIDIA 内部基准测试显示,NeMo Switchyard 在保持前沿级准确性的同时,将任务完成成本降低至仅使用 Opus 4.8 时的近三分之一。

NVIDIA 正在与 AI 生态系统中的合作伙伴携手,将智能模型路由引入开发者已使用的工具和平台。

  • Boomi:在五项路由能力上评估了 Switchyard,实现了 100% 的领域路由准确性,将 59% 的流量发送至一个快 5 倍的微调模型,并将后续轮次延迟降低了 21%。
  • Cadence:通过使用 ChipStack AI Super Agent 进行形式验证用例,效率提升了 9.9%。
  • Classmethod:在内部使用 NeMo Switchyard 运行 opencode 和 Fireworks 工作负载,初步测试显示成本降低了 27%,同时保持了质量。
  • Cognition:已将 NVIDIA NeMo Switchyard 分阶段路由器集成到 Devin Desktop 中供 NVIDIA 内部使用,在 FrontierCode Main 上实现了接近前沿的性能,同时与将所有请求路由至单一底层前沿模型相比,平均成本降低了 28%。
  • Kong:通过Kong AI Gateway原生集成NeMo Switchyard,实现路由功能。
  • LangChain:借助NeMo Switchyard,在145个多轮Deep Agents任务中,仅将7%的调用路由至前沿模型,便实现了74%的成本降低,同时仅牺牲6%的准确率。
  • LiteLLM:正在将NeMo Switchyard作为插件集成到其代理层,使开发者无需更改现有技术栈即可享受这些优势。
  • Nous Research:已将NeMo Switchyard集成到Hermes中,为开发者提供易于配置的路由系统,以提升代理效率。
  • Ramp:在Ramp SWE-Bench中,使用NeMo Switchyard达到了前沿模型的性能水平,同时将成本削减58%,运行时间缩短33%。
  • Siemens:正在对其Fuse EDA AI Agent进行基准测试,以提升效率。
  • Nemotron 3.5 Lightning现已通过Hugging FaceModelScopeOpenRouterbuild.nvidia.com提供,以NVIDIA NIM微服务形式发布,并可通过NVIDIA云合作伙伴、后训练平台、推理平台及云服务提供商的广泛生态系统获取。NeMo Switchyard已在GitHub上开放,并即将登陆合作伙伴平台。

    原始来源: Hacker News

    评论 (0)