进阶 docs.antigma.ai 2026-10-08 09:54:38 · 6 阅读
第21章 自定义推理引擎
Custom Engines
离线模式开箱即用,可直接使用 Ante 安装并托管的引擎。你也可以替换二进制文件、自定义模型和 GPU 选项,或接入自托管的服务器。
使用自定义 llama.cpp 构建版本
Ante 按以下顺序解析引擎二进制文件:
锁定在 offline-config.json 中的二进制路径(见下文)
托管的 ~/.ante/llama.cpp/current/llama 多路复用器
在托管模式下,Ante 不会自动发现 PATH 中的任意安装。若要使用自定义构建版本,请在 ~/.ante/offline-config.json 中设置 llama_cpp.binaries.server 指向你的 llama 多路复用器:
{
"llama_cpp": {
"binaries": {
"server": "/opt/llama.cpp/build/bin/llama"
}
}
}
该文件必须存在且支持 llama serve。若旧配置中保存的路径以 llama-server 结尾,系统会自动解析到同目录下的 llama,因此现有的托管安装无需重写配置即可平滑迁移。如果该多路复用器不存在,请通过 ante offline install 安装支持的引擎,或更新自定义路径。
备注:Ante 通常在安装时自动写入这些字段。若将它们指向自定义构建版本,版本检查可能会提示“升级”回锁定版本——请拒绝该提示以保留你的自定义版本。
调优托管推理
两个关键参数控制托管推理行为:
针对单个模型的额外参数。在模型偏好设置中配置 extra_args 以添加 llama.cpp 模型选项。该字符串按 shell 风格解析(支持引号),并转换为该模型的路由器预设,因此提供的值会覆盖 Ante 的模型默认设置,且无需重启共享服务器:
{
"model_preferences": {
"Qwen3.6-27B-Q4_K_M.gguf": {
"model_id": "Qwen3.6-27B-Q4_K_M.gguf",
"extra_args": "--threads 12 --load-mode mmap --cache-type-k q8_0"
}
}
}
路由器专属或改变身份的参数(如 --host、--port、--model、--alias)会被拒绝。无效值也会明确报错,而非生成一个导致实际上下文、温度或推理状态与 Ante 报告不一致的预设。
Ante v0.2.8 将 llama.cpp 版本锁定在 b11200。旧加载参数 --mlock、--mmap、--no-mmap、--dio / --direct-io 以及 --ndio / --no-direct-io 均已被弃用。请在保存的 extra_args 中用 --load-mode 替换它们,并选择你的引擎支持的加载模式,例如上文中的 --load-mode mmap。
GPU 卸载。llama_cpp.server_defaults.gpu_layers 控制 -ngl 的值。默认值 -1 将所有层卸载到 GPU;如果显存紧张,请降低该值:
{
"llama_cpp": {
"server_defaults": { "gpu_layers": 24 }
}
}
接入运行中的服务器 你可以自行运行 llama-server——使用任意构建版本和启动参数——然后让 Ante 作为客户端连接它。Ante 会自动扫描本地 8080-8179 端口,同时也支持从 /offline-mode 界面通过 Ctrl+A 手动指定 host:port 进行接入。有关端点输入、Docker 示例、断开连接行为以及远程主机数据流转的注意事项,请参阅“现有服务器”章节。 使用完全不同的引擎 任何提供兼容 OpenAI 端点的服务——如 Ollama、vLLM、LM Studio,或局域网中的 GPU 机器——都可以作为常规目录提供商为 Ante 提供服务。这种接入方式仅提供提供商机制(如模型选择器、通信协议);本页所提及的生命周期管理、内存估算及加载进度显示,仅适用于托管的 llama.cpp 引擎。请参阅“添加本地提供商”。
}
}
接入运行中的服务器 你可以自行运行 llama-server——使用任意构建版本和启动参数——然后让 Ante 作为客户端连接它。Ante 会自动扫描本地 8080-8179 端口,同时也支持从 /offline-mode 界面通过 Ctrl+A 手动指定 host:port 进行接入。有关端点输入、Docker 示例、断开连接行为以及远程主机数据流转的注意事项,请参阅“现有服务器”章节。 使用完全不同的引擎 任何提供兼容 OpenAI 端点的服务——如 Ollama、vLLM、LM Studio,或局域网中的 GPU 机器——都可以作为常规目录提供商为 Ante 提供服务。这种接入方式仅提供提供商机制(如模型选择器、通信协议);本页所提及的生命周期管理、内存估算及加载进度显示,仅适用于托管的 llama.cpp 引擎。请参阅“添加本地提供商”。