进阶 docs.antigma.ai 2026-10-08 09:54:38 · 6 阅读

第22章 使用已有服务器

已有服务器 当你已经自行运行 llama-server 时,即可使用现有服务器,例如 Docker 容器、自定义编译的 llama.cpp、局域网内的其他机器,或包含 Ante 未直接管理的特定参数分支。 Ante 仍将此端点视为本地提供商,因此标准的智能体循环、模型切换和提供商行为与托管的离线模型一致。Ante 不接管外部连接的服务器,也不会替你停止它们。 自动检测本地服务器 打开 TUI 并执行: /offline-mode
Ante 会扫描本地主机 8080 至 8179 端口,查找兼容 llama.cpp 的服务器。它会检查 /health 接口,从 /v1/models 读取模型名称,并在本地和已验证模型上方列出检测到的服务器。 即使未安装 Ante 指定的 llama.cpp 引擎,此扫描也会执行。若检测到正在运行的服务器,选中并按 Enter 即可连接。 手动连接 在 /offline-mode 界面下,按 Ctrl+A 并输入端点: 127.0.0.1:8080
仅输入端口号默认指向 127.0.0.1: 8080
也支持主机名: llama-box.local:8080
此对话框不支持括号内的 IPv6 端点输入。连接失败将在 Ante 探测 /health 和 /v1/models 后显示在离线模式对话框中。 模型加载期间的连接 llama-server 在模型加载期间,/health 接口会持续返回 503 错误——小模型可能只需几秒,大模型则需几分钟。在此期间连接是安全的:Ante 会识别加载状态,等待并在服务器就绪后自动完成连接。如果加载过程中服务器崩溃,Ante 将报告该错误,且等待上限为 10 分钟。 这对 Docker 容器尤为重要,因为其“健康”状态可能在模型尚未完成加载前就已显示。 Docker 示例 以下命令启动官方 llama.cpp 服务器镜像,并暴露端口 8080 供 Ante 使用: docker run --rm \
-p 8080:8080 \
-v "$PWD/models:/models" \
ghcr.io/ggml-org/llama.cpp:server \
--model /models/model.gguf \
--host 0.0.0.0 \
--port 8080 \
--ctx-size 32768 \
--jinja

对于 CUDA 构建,请使用对应的 llama.cpp 镜像,例如 ghcr.io/ggml-org/llama.cpp:server-cuda,并加上你机器所需的 Docker GPU 运行时参数。

Detach 行为

当 Ante 启动其管理的 llama serve 路由器时,它会接管该进程并可以随时停止它。当 Ante 连接到外部的 llama-server 时,停止离线模式只会让 Ante 从该端点断开,外部服务器会继续运行。

本地供应商只有在服务器已注册(无论是管理还是连接模式)时,才会出现在目录中。断开连接后,本地供应商会从目录中移除;此时若没有服务器在运行,选中它将显示提示信息而非重试失效端点;执行 /offline-mode 可重新启动或连接服务器。

连接到非回环主机(non-loopback host)会将你的对话数据发送到该主机。请只连接你有意操作或信任的远程端点。

相关环境变量

ANTE_OFFLINE_CONTEXT 用于更改 Ante 启动托管离线模型时的默认上下文窗口上限。它不会影响你从外部启动的服务器。

评论 (0)