Ollama 0.30 发布:性能提升与 GGUF 模型支持增强
Ollama 0.30 现已发布,借助 llama.cpp 带来了更出色的性能与 GGUF 模型兼容性。此版本与 Ollama 在 Apple 芯片上的 MLX 引擎形成互补,让更多模型能够在更广泛的硬件上运行。
更多 GPU,更强性能
NVIDIA 硬件吞吐量提升
得益于 NVIDIA 与 llama.cpp 团队贡献的优化,Ollama 0.30 在 NVIDIA 硬件上的性能提升了高达 20%。
测试环境:NVIDIA RTX 5090 显卡上运行 Gemma 4 26B 模型,采用 Q4_K_M 量化。
Vulkan 带来更广泛的硬件支持
Vulkan 现已默认启用,将 Ollama 的 GPU 加速扩展到更多硬件,包括 AMD 和 Intel 设备。更多用户无需安装厂商专用库,即可开箱即用地在 GPU 上运行模型。
支持更多模型
Ollama 0.30 扩展了对 GGUF 生态的兼容,让更多模型开箱即用,包括 LFM 和 Prism 等模型系列,以及 Unsloth 发布的微调模型。
从 Hugging Face 运行 GGUF 模型
首先,下载 GGUF 文件或包含 GGUF 文件的目录。然后,创建一个 Modelfile,使用 FROM 命令指向 GGUF 文件(或目录)的路径:
FROM ./my-model.Q4_K_M.gguf
接着创建并运行模型:
ollama create -f Modelfile my-model
ollama run my-model
编程 Agent 与助手
如果模型支持工具调用(tool calling),该能力同样适用于 Ollama。只需一条命令,即可搭配你常用的编程 Agent 和个人助手使用这些模型。
Claude Code
ollama launch claude --model my-model
Hermes Agent
ollama launch hermes --model my-model
OpenClaw
ollama launch openclaw --model my-model
要验证 GGUF 文件是否支持工具调用,可以使用 ollama show 命令查看是否包含 tools 这一能力项:
ollama show my-model
致谢
我们要感谢 Georgi Gerganov 以及 llama.cpp 各维护者团队所做的工作,同时感谢 NVIDIA、AMD、Qualcomm 和 Intel 等硬件合作伙伴,他们在各自平台上为优化 GGML 生态的性能付出了大量努力。
如有反馈,欢迎加入 Ollama 的 Discord 社区,或发送邮件至 hello@ollama.com 与我们联系。