← 文章 / 未分类
vercel 15小时前 · 2026-09-18 03:16:05 · 1 阅读

在 Vercel Sandbox 上运行 Terminal-Bench 及其他 Harbor 评估

现在可以在 Vercel Sandbox 上运行 Harbor 评测了。

HarborTerminal-Bench 背后的开源测试框架,其注册表还收录了 SWE-bench、tau3-bench 和 OSWorld 等众多基准测试。向 harbor run 传入 --env vercel 参数,每次试验都会在独立的 Firecracker microVM 中执行,从而实现远超本地机器能力的并行化。

任务的网络策略由 sandbox 防火墙在 VM 外部强制执行。可选的凭据注入功能会在该防火墙处将密钥附加到匹配的出站请求中,确保密钥绝不上进 sandbox。

配合 AI Gateway,一个 AI_GATEWAY_API_KEY 即可访问来自多个提供商的数百种模型,使用不同模型进行基准测试只需更改 --model 参数即可:

1uv tool install 'harbor[vercel]'2export VERCEL_TOKEN="<your-token>"3export AI_GATEWAY_API_KEY="<your-key>"4
5harbor run -d terminal-bench/terminal-bench-2-1 \6  --agent fx \7  --model vercel_ai_gateway/anthropic/claude-fable-5 \8  --env vercel \9  --n-concurrent 8

--model 替换为 vercel_ai_gateway/openai/gpt-5.6-luna,即可针对 OpenAI 模型运行相同的基准测试。

需要 Harbor 0.22.0 或更高版本。请参阅 分步指南 了解设置、配置和故障排除。更多详情参见 Sandbox 文档

原始来源: vercel

评论 (0)