进阶 docs.antigma.ai 2026-10-08 09:54:38 · 6 阅读

第2章 Terminal-Bench 2.1 实时评测

第2章 Live Eval

跳转至主要内容

Terminal-Bench 2.1:一套评测框架,释放所有模型的潜力

使用一致参数和经过验证的基准结果,对比不同模型在相同 Terminal-Bench 2.1 任务集上的 Ante 运行表现。

* 最高准确率:83.9% * 领先模型:DeepSeek V4.1 Flashmax * 任务集规模:89 个任务 * 测试轮次:445 次测试中 370 次通过

基准测试原则 [阅读更多 →]

* 只测已发布内容:所有评测均基于固定的公开版本。不存在专为评测设计的分支或特定基准提示词。 * 运行可审计:每个结果都关联其原始 Harbor 运行记录,任何人都可以检查数字背后的测试细节。 * 约束条件官方化:所有测试均遵循官方 Terminal-Bench 参数:89 个任务,每个任务 5 次测试,严格的超时限制和硬件限制。

模型组织 所有模型组织

TB 2.1 · 相同参数:89 个任务 · 每任务 5 次测试 · 更新于 2026 年 9 月 13 日

| # | 模型 | 同模型排名 | Agent | 来源 | 成本 | 耗时 | 链接 | 日期 | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | 1 | DeepSeek V4.1 Flashmax | 83.9% ± 1.75 SE | #1 同模型 | Ante | $17.96 | 11.5 min | Harbor 链接 | 2026 年 9 月 13 日 | | 2 | DeepSeek V4 Flash 0731max | 82.7% ± 1.79 SE | #1 同模型 | Ante | $68.41 | 38.9 min | Harbor 链接 | 2026 年 8 月 9 日 | | 3 | Grok 4.5medium | 80.9% ± 1.27 SE | #1 同模型 | Ante | $242.57 | 8.4 min | PR #129 | 2026 年 7 月 10 日 | * ⓘ 在 20 条轨迹中识别出奖励作弊行为。显示得分已排除这些数据;详情见来源中的 PR #129。 | 4 | GLM 5.2 | 74.6% ± 2.06 SE | #1 同模型 | Ante | $260.11 | 11.3 min | Harbor 链接 | 2026 年 6 月 20 日 | | 5 | DeepSeek V4 Pro | 69.1% ± 2.24 SE | #1 同模型 | Ante | $26.34 | 48.4 min | Harbor 链接 | 2026 年 7 月 7 日 | | 6 | DeepSeek V4 Flash | 66.4% ± 2.27 SE | 无公开数据 | Ante | $49.98 | 41.4 min | Harbor 链接 | 2026 年 7 月 5 日 | | 7 | MiMo V2.5 | 65.8% ± 2.30 SE | #1 同模型 | Ante | $73.76 | 12.5 min | Harbor 链接 | 2026 年 6 月 25 日 | | 8 | MiniMax M3 | 62.1% ± 2.33 SE | #1 同模型 | Ante | $121.00 | 13.9 min | Harbor 链接 | 2026 年 6 月 23 日 | | 9 | Qwen3.6 27B | 56.2% ± 2.36 SE | 本地 | 无公开数据 | - | 61.6 min | Harbor 链接 | 2026 年 7 月 3 日 |

*(注:Agent 列中的版本号如 20260911-0727-4f99a30 等保留原文,作为特定的构建标识)*

Ante · TB 2.1 Ante 性能 Ante 运行的得分与成本、耗时的关系。两个坐标轴均从零点开始。

Ante 模型 · 成本 * X轴:每次测试成本(美元),从 $0.000 到 $0.70 * Y轴:得分,0% 到 100% * 包含模型:DeepSeek V4.1 Flash, DeepSeek V4 Pro, DeepSeek V4 Flash, DeepSeek V4 Flash 0731, MiMo V2.5, MiniMax M3, Grok 4.5, GLM 5.2

*说明:线条标出了所绘模型中的帕累托前沿(Pareto frontier):没有显示的运行同时具备更低成本(或更快耗时)和更高得分。每次测试的成本是运行总成本除以测试次数,因此不同测试次数的运行使用相同的单位。测试次数和评测框架可能不同;请检查每个运行以获取详情。水平虚线延伸显示的是在更大预算下观察到的最佳得分,而非额外测量的运行。共绘制 8 个运行,因缺少成本数据隐藏了 1 个。*

Ante 模型 · 耗时 * X轴:每次测试耗时,从 0s 到 70m * Y轴:得分,0% 到 100% * 包含模型:Grok 4.5, GLM 5.2, DeepSeek V4.1 Flash, MiMo V2.5, MiniMax M3, DeepSeek V4 Flash 0731, DeepSeek V4 Flash, DeepSeek V4 Pro, Qwen3.6 27B

*说明:线条标出了所绘模型中的帕累托前沿:没有显示的运行同时具备更低成本(或更快耗时)和更高得分。耗时是原始 Harbor 摘要中的平均单次测试耗时,因此测试次数不会改变此值。水平虚线延伸显示的是在更大预算下观察到的最佳得分,而非额外测量的运行。共绘制 9 个运行。*

Terminal-Bench 参考 经验证的公开排行榜 相同参数:89 个任务 · 每任务 5 次测试 · 更新于 2026 年 9 月 14 日 · 来源:Terminal-Bench 官方验证数据 关于不同模型在 TB 2.1 上的表现,请参阅 Vals AI 的 Terminal-Bench 2.1 基准测试。

22 个官方条目

| # | Agent | 模型 | 准确率 | 运行日期 | | :--- | :--- | :--- | :--- | :--- | | 1 | Codex | GPT-6 Astrahigh | 87.4% ± 0.91 SE | 2026 年 9 月 3 日 | | 2 | Codex | GPT-6 Astramedium | 87.0% ± 0.96 SE | 2026 年 9 月 3 日 | | 3 | Codex | GPT-6 Astralow | 86.7% ± 0.93 SE | 2026 年 9 月 3 日 | | 4 | Codex | GPT-6 Astramax | 86.7% ± 0.69 SE | 2026 年 9 月 3 日 | | *插队说明* | *Ante + DeepSeek V4.1 Flash 模型 · 83.9% 将位于公开排名 #5 和 #6 之间* | | | | | 5 | Codex | GPT-6 Astraxhigh | 85.8% ± 0.73 SE | 2026 年 9 月 3 日 | | 6 | Claude Code | Fable 5xhigh | 83.8% ± 1.16 SE | 2026 年 6 月 9 日 | | *插队说明* | *Ante + DeepSeek V4 Flash 0731 模型 · 82.7%;Ante + Grok 4.5 模型 · 80.9% 将位于公开排名 #7 和 #8 之间* | | | | | 7 | Codex | GPT-5.5xhigh | 83.2% ± 1.13 SE | 2026 年 4 月 23 日 | | 8 | Terminus 2 | Fable 5high | 80.5% ± 1.16 SE | 2026 年 6 月 9 日 | | 9 | Cursor CLI | Grok 4.5high | 79.3% ± 1.46 SE | 2026 年 7 月 8 日 | | 10 | Claude Code | Opus 4.8high | 78.9% ± 1.31 SE | 2026 年 5 月 28 日 | | 11 | Codex | GPT-5.6 Terramax | 78.4% ± 1.25 SE | 2026 年 6 月 26 日 | | 12 | Terminus 2 | GPT-5.5xhigh | 78.0% ± 1.22 SE | 2026 年 4 月 23 日 | | 13 | mini-SWE-agent | Muse Spark 1.1xhigh | 76.2% ± 1.23 SE | 2026 年 7 月 9 日 | | 14 | Codex | GPT-5.6 Lunamax | 75.7% ± 1.32 SE | 2026 年 6 月 26 日 | | *插队说明* | *Ante + GLM 5.2 模型 · 74.6% 将位于公开排名 #15 和 #16 之间* | | | | | 15 | Claude Code | Sonnet 5high | 74.6% ± 1.64 SE | 2026 年 6 月 30 日 | | *插队说明* | *Ante + DeepSeek V4 Pro 模型 · 69.1% 将位于公开排名 #16 和 #17 之间* | | | | | 16 | Terminus 2 | Gemini 3 Prohigh | 73.9% ± 1.29 SE | 2025 年 11 月 18 日 | | *插队说明* | *Ante + DeepSeek V4 Flash 模型 · 66.4% 将位于公开排名 #17 和 #18 之间* | | | | | 17 | Claude Code | Opus 4.7max | 68.9% ± 1.41 SE | 2026 年 4 月 16 日 | | 18 | Terminus 2 | Opus 4.7max | 66.1% ± 1.37 SE | 2026 年 4 月 16 日 | | 19 | Gemini CLI | Gemini 3 Prohigh | 65.8% ± 1.38 SE | 2025 年 11 月 18 日 | | *插队说明* | *Ante + MiMo V2.5 模型 · 65.8% 将位于公开排名 #20 和 #21 之间* | | | | | 20 | Gemini CLI | Gemini 3.1 Prohigh | 65.8% ± 1.67 SE | 2026 年 2 月 19 日 | | *插队说明* | *Ante + MiniMax M3 模型 · 62.1% 将位于公开排名 #21 和 #22 之间* | | | | | 21 | Terminus 2 | Gemini 3.1 Prohigh | 65.6% ± 1.65 SE | 2026 年 2 月 19 日 | | *插队说明* | *Ante + Qwen3.6 27B 模型 · 56.2% 将位于公开排名 #22 之下* | | | | | 22 | Claude Code | GLM-5.1max | 58.6% ± 1.24 SE | 2026 年 3 月 27 日 |

评论 (0)