← 文章 / 开源项目
Ollama 博客 3小时前 · 2026-08-31 13:11:01 · 2 阅读

Ollama 0.30 发布:性能提升与 GGUF 模型支持增强

Ollama 0.30 现已发布,借助 llama.cpp 带来了更出色的性能与 GGUF 模型兼容性。此版本与 Ollama 在 Apple 芯片上的 MLX 引擎形成互补,让更多模型能够在更广泛的硬件上运行。

更多 GPU,更强性能

NVIDIA 硬件吞吐量提升

得益于 NVIDIA 与 llama.cpp 团队贡献的优化,Ollama 0.30 在 NVIDIA 硬件上的性能提升了高达 20%。

测试环境:NVIDIA RTX 5090 显卡上运行 Gemma 4 26B 模型,采用 Q4_K_M 量化。

Vulkan 带来更广泛的硬件支持

Vulkan 现已默认启用,将 Ollama 的 GPU 加速扩展到更多硬件,包括 AMD 和 Intel 设备。更多用户无需安装厂商专用库,即可开箱即用地在 GPU 上运行模型。

支持更多模型

Ollama 0.30 扩展了对 GGUF 生态的兼容,让更多模型开箱即用,包括 LFMPrism 等模型系列,以及 Unsloth 发布的微调模型。

从 Hugging Face 运行 GGUF 模型

首先,下载 GGUF 文件或包含 GGUF 文件的目录。然后,创建一个 Modelfile,使用 FROM 命令指向 GGUF 文件(或目录)的路径:

FROM ./my-model.Q4_K_M.gguf

接着创建并运行模型:

ollama create -f Modelfile my-model
ollama run my-model

编程 Agent 与助手

如果模型支持工具调用(tool calling),该能力同样适用于 Ollama。只需一条命令,即可搭配你常用的编程 Agent 和个人助手使用这些模型。

Claude Code

ollama launch claude --model my-model

Hermes Agent

ollama launch hermes --model my-model

OpenClaw

ollama launch openclaw --model my-model

要验证 GGUF 文件是否支持工具调用,可以使用 ollama show 命令查看是否包含 tools 这一能力项:

ollama show my-model

致谢

我们要感谢 Georgi Gerganov 以及 llama.cpp 各维护者团队所做的工作,同时感谢 NVIDIA、AMD、Qualcomm 和 Intel 等硬件合作伙伴,他们在各自平台上为优化 GGML 生态的性能付出了大量努力。

如有反馈,欢迎加入 Ollama 的 Discord 社区,或发送邮件至 hello@ollama.com 与我们联系。

原始来源: Ollama 博客

评论 (0)