Ollama 博客 5小时前 · 2026-09-02 17:14:57 · 0 阅读
NVIDIA Nemotron 3.5 Lightning 本地模型发布
NVIDIA Nemotron 3.5 Lightning 现已登陆 Ollama,完全在本地运行。这是一款 300 亿参数(3B 激活参数)的 NVIDIA 开源模型,专为需要持续运行的智能体设计:能够收集上下文、调用工具并处理多步骤任务。
Nemotron 3.5 Lightning 专为智能体任务打造,例如读取文件、调用工具、整理结果以及重试失败操作。这些步骤大多不需要大型模型。其每 token 仅 3B 激活参数,专为本地系统而非数据中心设计,本地运行意味着您的数据始终留在设备上。
模型亮点
- 随处运行: 采用混合 MoE 架构,总参数 300 亿,每 token 仅 3B 激活参数。可在 NVIDIA RTX PC、RTX PRO 工作站、DGX Spark、DGX Station 以及数据中心和云端运行。
- 专为智能体框架打造: 由 Nemotron Coalition 开发,针对开发者常用的工具进行训练,涵盖编码、工具调用、指令遵循和多轮工作流。
- 100 万 token 上下文: 上下文长度最高可达 100 万,为多轮工作流中的长工具历史记录留出空间。
- 推理优化: 采用多 token 预测(MTP)、DFlash 或 DSpark 等推测解码技术,吞吐量比同等开源模型高出 4 倍。
- 可定制: 基于开源数据集训练的开源模型。可针对特定任务进行后训练,并将结果部署在从边缘到数据中心的任何地方。
你能构建什么
Nemotron 3.5 Lightning 在以下工作负载上表现出色:
- 长运行个人助理。 处理邮件、日历、项目和预订。由于在本地运行,智能体可以利用本地上下文,且数据不会发送到其他地方。
- 编码子智能体。 在你已有的框架内运行测试、搜索代码库并应用重构。
- **安全运营**:丰富告警、分类事件、查询日志、关联指标,并为分析师准备结构化结论。
- **本地与云端的分层架构**:Nemotron 3.5 Lightning 负责处理高吞吐量的本地步骤,少量需要更大模型的任务则由托管模型承接。CLI 和 API 保持一致。
- **可自训练的专家模型**:提供开源权重和数据集,你可以针对特定任务对 Nemotron 3.5 Lightning 进行微调,并在本地运行结果。
快速开始
下载 Ollama,然后使用你喜欢的工具运行 Nemotron 3.5 Lightning。 **通用对话**ollama run nemotron-3.5-lightning
**Claude Code**
ollama launch claude --model nemotron-3.5-lightning
**OpenClaw**
ollama launch openclaw --model nemotron-3.5-lightning
**Hermes Agent**
ollama launch hermes --model nemotron-3.5-lightning
**OpenCode**
ollama launch opencode --model nemotron-3.5-lightning
对于 Apple Silicon 用户,Ollama 提供了性能领先的模型:nemotron-3.5-lightning:30b-mlx。
在模型页面查看 更多集成。
Ollama 云端运行的模型也遵循相同的模式,因此 Agent 可以在不改变其他配置的情况下,将单个步骤发送给更大的模型。
性能基准
与同规模的其他主流开源模型相比,Nemotron 3.5 Lightning 提供了 4 倍更高的吞吐量和 30% 更快的任务完成速度,并在智能体、编码和推理任务上表现出领先的准确率。对于持续运行的 Agent,吞吐量是最关键的指标:每分钟更多的步骤意味着长任务能更快完成。完整结果和测试配置请参阅 NVIDIA 的发布博客。原始来源: Ollama 博客