Ollama 预览版现已支持 Apple Silicon 上的 MLX 后端

今天,我们预览了在 Apple 芯片上运行 Ollama 的最快方式:由 Apple 的机器学习框架 MLX 提供支持。
它释放了新的性能,加速你在 macOS 上最繁重的工作负载:
- 类似 OpenClaw 的个人助手
- 类似 Claude Code、OpenCode 或 Codex 的编程 Agent
加速 Pi 或 Claude Code 等编程 Agent
OpenClaw 现在响应速度大幅提升
由 MLX 驱动的 Apple 芯片最快性能
在 Apple 芯片上运行的 Ollama 现已构建于 Apple 的机器学习框架 MLX 之上,以充分利用其统一内存架构。
这使得 Ollama 在所有 Apple Silicon 设备上获得大幅加速。在 Apple 的 M5、M5 Pro 和 M5 Max 芯片上,Ollama 利用全新的 GPU 神经加速器来同时提升首 token 时间(TTFT)和生成速度(tokens per second)。
预填充性能
解码性能
测试于 2026 年 3 月 29 日进行,使用阿里巴巴的 Qwen3.5-35B-A3B 模型(NVFP4 量化)以及 Ollama 旧版实现(Q4_K_M 量化),测试环境为 Ollama 0.18。Ollama 0.19 将带来更高的性能(int4 量化下可达 1851 token/s 预填充和 134 token/s 解码)。
NVFP4 支持:更高质量的响应,与生产环境对齐
Ollama 现已采用 NVIDIA 的 NVFP4 格式,在减少推理工作负载的内存带宽和存储需求的同时保持模型精度。
随着越来越多的推理服务商采用 NVFP4 格式进行规模化推理,Ollama 用户也能获得与生产环境一致的结果。
这还让 Ollama 具备了运行由 NVIDIA model optimizer 优化后模型的能力。其他精度格式将根据 Ollama 研究与硬件合作伙伴的设计和使用需求陆续推出。
改进的缓存,带来更灵敏的响应
Ollama 的缓存已升级,让编程和 Agent 类任务更加高效。
更低的内存占用:Ollama 现在可以在不同会话之间复用缓存,从而降低内存占用,并在使用共享系统提示(例如配合 Claude Code 这类工具)时提升缓存命中率。
智能检查点:Ollama 会在提示词中合适的位置保存缓存快照,从而减少提示词处理量,加快响应速度。
更智能的淘汰策略:即便较早的分支被丢弃,共享前缀也能保留更长时间。
开始使用
本次 Ollama 预览版对全新的 Qwen3.5-35B-A3B 模型做了加速,采样参数也针对编程任务进行了调优。
请确保你的 Mac 拥有超过 32GB 的统一内存。
Claude Code:
ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4
OpenClaw:
ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4
直接与模型对话:
ollama run qwen3.5:35b-a3b-coding-nvfp4
未来模型
我们正在积极推进更多模型的支持。对于在已支持架构上微调的自定义模型,后续将提供更便捷的方式导入到 Ollama。与此同时,我们也会不断扩大支持的架构范围。
致谢
感谢以下团队:
- MLX 贡献者团队,打造了出色的加速框架
- NVIDIA 的贡献者们,在 NVFP4 量化、NVFP4 模型优化器、MLX CUDA 支持以及 Ollama 的优化与测试方面作出了贡献
- GGML 与 llama.cpp 团队,构建了活跃的本地推理框架和生态
- 阿里巴巴 Qwen 团队,开源了优秀的模型并与我们紧密协作