第19章 为何选择本地部署:Ante 的自包含推理架构
为自包含而生 Ante 是一个单一的自包含二进制文件(压缩后约 15MB),自带推理引擎。放入一个 GGUF 文件,你就在自己的硬件上拥有了一个完整的编码 agent:不需要 API key,不需要账号,模型调用也永远不会离开你的机器。
隐私边界:本地推理让模型的请求和响应都留在你的硬件上。Ante 的应用遥测与模型流量是分开的;设置 ANTE_TELEMETRY=off 后,运行期间不会导出任何 OpenTelemetry 指标或日志。这不会禁用本地日志文件。详见 Telemetry。
本地是 Ante 的一等运行方式。托管与本地提供方共用同一个目录,运行同样的完整 prompt 和工具栈,接受同样的公开基准测试。每个会话你都可以按任务需要选择用哪一种。
选择你的部署形态
部署形态 具体表现 适用场景
全托管 只用托管提供方 追求最强能力,且有网络和预算
混合 本地与托管并存,按会话或会话中途切换 部分工作涉及隐私或高调用量,部分需要前沿模型
全本地 全部由内置引擎服务 离线环境、严格的隐私要求、零边际成本
Ante 如何对待本地模型
与普通提供方一视同仁。任何带 OpenAI 兼容端点的本地服务(Ollama、vLLM、LM Studio 或你自己的)都通过与托管提供方相同的 catalog.json 机制注册。没有特殊处理,日后也无迁移负担。参见 local provider setup 和 Catalog Reference。
原生集成。Ante 不只是容忍一个 base URL。离线模式会直接管理 llama.cpp 本身:针对你的硬件提供锁定版本、经校验和验证的构建(Apple 芯片用 Metal,Linux 用 CUDA、Vulkan 或 CPU),自动发现磁盘上的 GGUF 文件,在模型加载前估算内存,实时显示加载进度,并在 TUI 中管理服务器生命周期。精选模型列表让你在下载 17 GB 之前就知道哪些模型运行良好。想用自己的构建或启动参数?Custom engines 可以满足。
面向 agent 的推理,开发中。终极目标是在 agent 进程内运行推理引擎,并针对 agent 实际调用模型的方式做优化:跨轮次复用前缀、为工具调用做受限解码、跨子 agent 批处理。我们正在通过 nanochat-rs 公开探索这一方向——这是一个可以克隆运行的小型纯 Rust 推理核心。参见 Agent-Native Inference。
本地与前沿模型混用
离线模式加载模型后,Ante 会将其注册为本地提供方:目录中一个普通的 OpenAI 兼容条目,与 Anthropic 或 OpenAI 并列。此后,混用就是普通的提供方机制:
会话中途切换。在 TUI 中用 /providers 即可切换提供方和模型,无需重启。可以先用前沿模型起草,遇到敏感仓库切到本地,再切回来。
按调用选择。ante --offline-model
多客户端共享一个模型。ante serve --offline-model
子 agent 用更轻的模型。子 agent 可以通过 model: frontmatter 指定自己的模型 id,让探索或搜索类 agent 在比主循环更小的模型上运行。
一个需要了解的边界:一个会话同一时间只能与一个提供方通信。切换是即时的,但子 agent 使用其父会话的提供方,因此目前还无法在同一会话内让主循环用前沿模型、子 agent 用本地模型。
可验证的数字
我们用与前沿模型同等的严格标准对本地模型做基准测试:相同的测试框架、相同的锁定公开构建、相同可审计的 Harbor 运行。Qwen3.6 27B(17 GB 下载)在 Terminal-Bench 2.1 上经 445 次试验取得 56.2% 的成绩——实时数据见 antigma.ai/eval,完整精选列表见 Verified Models。