进阶 docs.antigma.ai 2026-10-08 09:54:38 · 6 阅读
第23章 已验证模型
第23章 已验证模型
离线模式选择器中的“已验证模型”列表经过精选:这些 GGUF 版本由我们从 Hugging Face 下载,并已在 Ante 的代理循环中完成测试,内存需求也预先明确。每个模型拥有两种状态之一:
- Evaled(已评估):完成了完整的公开基准测试。使用与前沿模型结果相同的 Terminal-Bench 2.1 测试框架、固定版本构建以及可审计的 Harbor 运行记录。具体数据见 antigma.ai/eval。
- Verified(已验证):完成了兼容性测试。模型能够加载,聊天模板解析正常,且在 Ante 的代理循环中工具调用功能正常。尚未进行完整评估。
随着基准测试的完成,模型将从 Verified 升级为 Evaled。
当前列表
| 模型 | 量化 | 下载 | 最大上下文 | 状态 |
|---|---|---|---|---|
| Qwen3.8 27B | Q4_K_M | 17 GB | 256K | Verified |
| MiniMax-M2.7 | Q3_K_XL | 102 GB | 192K | Verified |
| Qwen3.5 122B-A10B | Q2_K | 45 GB | 256K | Verified |
| Qwen3.6 35B-A3B | Q4_K_M | 22 GB | 256K | Verified |
| Qwen3.6 27B | Q4_K_M | 17 GB | 256K | Evaled — 在 Terminal-Bench 2.1 中得分 56.2% |
| GLM-4.7-Flash | Q4_K_M | 18 GB | 198K | Verified |
| Gemma 4 26B-A4B-it | Q4_K_M | 16 GB | 256K | Verified |
| Devstral-Small-2 24B | Q4_K_M | 14 GB | 384K | Verified |
| Qwen3.5 9B | Q4_K_M | 5.7 GB | 256K | Verified |
| Gemma 4 E4B-it | Q4_K_M | 4.7 GB | 128K | Verified |
“最大上下文”指模型支持的上限。Ante 将默认上下文窗口限制为 32K 以保持内存可预测性,用户可在偏好设置中或通过 ANTE_OFFLINE_CONTEXT 变量按模型单独调整该值。
目前唯一的评估结果:Qwen3.6 27B 在 89 个 Terminal-Bench 2.1 任务(共 445 次试验)中达到了 56.2% 的准确率——这个仅需 17 GB 下载的模型,在我们用于前沿模型的同一基准测试中表现稳健。
添加自定义模型
启动时,Ante 会将 ~/.ante/verified_models.json 合并到内置列表之上。如果条目的文件名与内置项匹配,则覆盖内置项;新文件名则追加到列表末尾。
{
"models": [
{
"name": "My Custom Model",
"repo": "username/repo-name",
"filename": "model-Q4_K_M.gguf",
"context_window": 32768,
"file_size_mb": 5000,
"kv_cache_bytes_per_token": 131072,
"support_vision": false
}
]
}
| 字段 | 描述 |
|---|---|
| name | 模型选择器中显示的名称 |
| repo | 文件下载的 Hugging Face 仓库 |
| filename | 仓库内的 GGUF 文件名(同时作为合并键) |
| context_window | 模型支持的最大上下文(token 数) |
| file_size_mb | 下载大小,用于内存估算 |
| kv_cache_bytes_per_token | 每个上下文 token 的 KV 缓存增量,用于内存估算 |
| support_vision | 模型是否接受图像输入(可选) |