← 文章 / AI技术
Ollama 博客 3小时前 · 2026-08-31 13:11:27 · 0 阅读

Ollama 预览版现已支持 Apple Silicon 上的 MLX 后端

Ollama 站在一辆既能日常通勤又能上赛道的跑车旁,展示在 Apple 芯片上的高性能表现

今天,我们预览了在 Apple 芯片上运行 Ollama 的最快方式:由 Apple 的机器学习框架 MLX 提供支持。

它释放了新的性能,加速你在 macOS 上最繁重的工作负载:

  • 类似 OpenClaw 的个人助手
  • 类似 Claude Code、OpenCode 或 Codex 的编程 Agent

    加速 Pi 或 Claude Code 等编程 Agent


    OpenClaw 现在响应速度大幅提升


由 MLX 驱动的 Apple 芯片最快性能

在 Apple 芯片上运行的 Ollama 现已构建于 Apple 的机器学习框架 MLX 之上,以充分利用其统一内存架构。

这使得 Ollama 在所有 Apple Silicon 设备上获得大幅加速。在 Apple 的 M5、M5 Pro 和 M5 Max 芯片上,Ollama 利用全新的 GPU 神经加速器来同时提升首 token 时间(TTFT)和生成速度(tokens per second)。

预填充性能

解码性能

测试于 2026 年 3 月 29 日进行,使用阿里巴巴的 Qwen3.5-35B-A3B 模型(NVFP4 量化)以及 Ollama 旧版实现(Q4_K_M 量化),测试环境为 Ollama 0.18。Ollama 0.19 将带来更高的性能(int4 量化下可达 1851 token/s 预填充和 134 token/s 解码)。

NVFP4 支持:更高质量的响应,与生产环境对齐

Ollama 现已采用 NVIDIA 的 NVFP4 格式,在减少推理工作负载的内存带宽和存储需求的同时保持模型精度。

随着越来越多的推理服务商采用 NVFP4 格式进行规模化推理,Ollama 用户也能获得与生产环境一致的结果。

这还让 Ollama 具备了运行由 NVIDIA model optimizer 优化后模型的能力。其他精度格式将根据 Ollama 研究与硬件合作伙伴的设计和使用需求陆续推出。

改进的缓存,带来更灵敏的响应

Ollama 的缓存已升级,让编程和 Agent 类任务更加高效。

  • 更低的内存占用:Ollama 现在可以在不同会话之间复用缓存,从而降低内存占用,并在使用共享系统提示(例如配合 Claude Code 这类工具)时提升缓存命中率。

  • 智能检查点:Ollama 会在提示词中合适的位置保存缓存快照,从而减少提示词处理量,加快响应速度。

  • 更智能的淘汰策略:即便较早的分支被丢弃,共享前缀也能保留更长时间。

开始使用

下载 Ollama 0.19

本次 Ollama 预览版对全新的 Qwen3.5-35B-A3B 模型做了加速,采样参数也针对编程任务进行了调优。

请确保你的 Mac 拥有超过 32GB 的统一内存。

Claude Code:

ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4

OpenClaw:

ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4

直接与模型对话:

ollama run qwen3.5:35b-a3b-coding-nvfp4

未来模型

我们正在积极推进更多模型的支持。对于在已支持架构上微调的自定义模型,后续将提供更便捷的方式导入到 Ollama。与此同时,我们也会不断扩大支持的架构范围。

致谢

感谢以下团队:

  • MLX 贡献者团队,打造了出色的加速框架
  • NVIDIA 的贡献者们,在 NVFP4 量化、NVFP4 模型优化器、MLX CUDA 支持以及 Ollama 的优化与测试方面作出了贡献
  • GGML 与 llama.cpp 团队,构建了活跃的本地推理框架和生态
  • 阿里巴巴 Qwen 团队,开源了优秀的模型并与我们紧密协作
原始来源: Ollama 博客

评论 (0)