← 文章 / AI技术
Ollama 博客 5小时前 · 2026-09-02 17:14:57 · 0 阅读

NVIDIA Nemotron 3.5 Lightning 本地模型发布

NVIDIA Nemotron 3.5 Lightning 现已登陆 Ollama,完全在本地运行。这是一款 300 亿参数(3B 激活参数)的 NVIDIA 开源模型,专为需要持续运行的智能体设计:能够收集上下文、调用工具并处理多步骤任务。 Nemotron 3.5 Lightning 专为智能体任务打造,例如读取文件、调用工具、整理结果以及重试失败操作。这些步骤大多不需要大型模型。其每 token 仅 3B 激活参数,专为本地系统而非数据中心设计,本地运行意味着您的数据始终留在设备上。

模型亮点

  • 随处运行: 采用混合 MoE 架构,总参数 300 亿,每 token 仅 3B 激活参数。可在 NVIDIA RTX PC、RTX PRO 工作站、DGX Spark、DGX Station 以及数据中心和云端运行。
  • 专为智能体框架打造: 由 Nemotron Coalition 开发,针对开发者常用的工具进行训练,涵盖编码、工具调用、指令遵循和多轮工作流。
  • 100 万 token 上下文: 上下文长度最高可达 100 万,为多轮工作流中的长工具历史记录留出空间。
  • 推理优化: 采用多 token 预测(MTP)、DFlash 或 DSpark 等推测解码技术,吞吐量比同等开源模型高出 4 倍。
  • 可定制: 基于开源数据集训练的开源模型。可针对特定任务进行后训练,并将结果部署在从边缘到数据中心的任何地方。

你能构建什么

Nemotron 3.5 Lightning 在以下工作负载上表现出色:

  • 长运行个人助理。 处理邮件、日历、项目和预订。由于在本地运行,智能体可以利用本地上下文,且数据不会发送到其他地方。
  • 编码子智能体。 在你已有的框架内运行测试、搜索代码库并应用重构。
    • **安全运营**:丰富告警、分类事件、查询日志、关联指标,并为分析师准备结构化结论。
    • **本地与云端的分层架构**:Nemotron 3.5 Lightning 负责处理高吞吐量的本地步骤,少量需要更大模型的任务则由托管模型承接。CLI 和 API 保持一致。
    • **可自训练的专家模型**:提供开源权重和数据集,你可以针对特定任务对 Nemotron 3.5 Lightning 进行微调,并在本地运行结果。

    快速开始

    下载 Ollama,然后使用你喜欢的工具运行 Nemotron 3.5 Lightning。 **通用对话**
    ollama run nemotron-3.5-lightning
    
    **Claude Code**
    ollama launch claude --model nemotron-3.5-lightning
    
    **OpenClaw**
    ollama launch openclaw --model nemotron-3.5-lightning
    
    **Hermes Agent**
    ollama launch hermes --model nemotron-3.5-lightning
    
    **OpenCode**
    ollama launch opencode --model nemotron-3.5-lightning
    
    对于 Apple Silicon 用户,Ollama 提供了性能领先的模型:nemotron-3.5-lightning:30b-mlx。 在模型页面查看 更多集成。 Ollama 云端运行的模型也遵循相同的模式,因此 Agent 可以在不改变其他配置的情况下,将单个步骤发送给更大的模型。

    性能基准

    与同规模的其他主流开源模型相比,Nemotron 3.5 Lightning 提供了 4 倍更高的吞吐量和 30% 更快的任务完成速度,并在智能体、编码和推理任务上表现出领先的准确率。对于持续运行的 Agent,吞吐量是最关键的指标:每分钟更多的步骤意味着长任务能更快完成。完整结果和测试配置请参阅 NVIDIA 的发布博客。
原始来源: Ollama 博客

评论 (0)