测试工程师的第一把AIAgent:DeepSeek 开源框架 5 分钟上手
程序员圈子里,AI Agent 已经火了大半年——让 AI 自己读代码、跑命令、改文件,一句「帮我把这个仓库的测试修好」就完事。
但测试这边,很多人还在问:「这跟我有什么关系?」
关系很大。因为那些「跑回归、读报告、定位失败用例、改脚本」的机械活,AI Agent 全都能接。而且门槛比你想的低——今天讲的这个框架,免费开源(MIT 协议),装好 Node.js 后一行命令就能跑起来。
它就是 DeepSeek AI 开源的 DeepSeek-Harness(命令行工具叫 `dsh`)。
01
一句话讲清楚它是什么
DeepSeek-Harness 是 DeepSeek AI 在 8 月 13 号跟 V4 Pro 同一天开源的「智能体框架」(agent harness)。
它的核心设计就一句话:一切皆插件。模型、工具、沙箱策略、多 Agent 协调、会话存储,全是插件,底层由 Cordis 微内核把它们拼起来。
这句话对你意味着三件事:
1. 模型能换 —— 不绑死在 DeepSeek,也能接 OpenAI 兼容端点、Kimi、GLM;
2. 工具有边界—— 它能读文件、写文件、跑命令,但每一步都受权限策略约束,不是撒手不管;
3. 入口很灵活 —— Web UI、命令行、Python SDK、桌面端,四种都能用。
三段链路:给它一句话,它干完一摊活
用一张图把它的工作方式说清楚——输入、中间产物、最终产出:


这里有个关键点,也是很多人第一次用会懵的地方:它不是一个「聊天机器人」,而是一个有文件系统、有 shell 的「实习生」。你给它的是「工作区」(一个真实目录),不是一段对话。
035 步上手
第 1 步:装 Node.js,一行命令起 Web UI
先确认装好 Node.js(建议 22+,用最新 LTS 更稳),然后:

跑起来后默认在 `http://127.0.0.1:3080` 打开 Web UI,本机启动时会自动弹浏览器。

第 2 步:配置模型
打开 `设置 → 模型`,在 DeepSeek 卡片里填你的 API Key,保存。
两个值得注意的点:
1)保存后立即可用,不用重启服务—— 模型路由是热生效的;
2)Key 只写不读 —— 保存后界面只回一个脱敏描述符,明文存在本地的 `$DSH_HOME/.credentials.yaml`。

顺带一个刚出的好消息:DeepSeek 9 月 10 号刚发了新模型 V4.1 Flash(模型名 `deepseek-flash`),552B 参数的 MoE,采用非对称的 Causal-Encoder-Decoder 结构,KV Cache 大幅缩小——对 HBM 的需求降到上一代的 1/4、SSD 降到 1/8,专门针对 Agent 场景里缓存命中的高成本。这意味着你用 `harness` 跑测试,模型侧的花费会比以前低一截。旧的 `deepseek-v4-flash` 模型名现在会自动路由到 V4.1 Flash,兼容期不用改。
第 3 步:选择工作区
点 `选择工作区`,把你要让它干活的项目目录加进去、选中。

这一步不做,会话输入框是灰的。 为什么?因为它要操作的是一套真实文件,你不告诉它「在哪个目录干活」,它就没法启动。这一步和第 2 步,是后面所有操作的前置条件。
第 4 步:发第一个任务
选中工作区后,输入框解锁。先发个稳妥的试水指令(这是官方入门给的第一个例子):
(总结这个仓库,找出它的主要模块。)
Agent 会读工作区里的文件、跑命令、维护执行计划,把结果一条条回给你。

第 5 步:看它干活,该审批就审批
当它要做的操作触发了权限策略(比如写文件、执行危险命令),Web UI 会先问你,而不是直接干。这也是它跟「裸跑一个 shell 脚本」的关键区别——每一步都可控。
顺序为什么不能乱
这三步——配置模型 → 选工作区 → 发任务——顺序是锁死的,反了会怎样?
1)不配模型就发任务 → 报 `MISSING_CREDENTIAL`,它不知道拿谁的 Key 调谁;
2)配了模型不选工作区 → 输入框直接锁死,你连指令都发不出去;
3)选了工作区但没配模型 → 模型路由是空的,任务照样起不来。
一句话:先给它「钥匙」(Key),再给它「地盘」(工作区),最后才轮到「活儿」(任务)。 这个顺序本身就是这个框架的安全模型,不是 UI 随便定的。
测试工程师的三个实战场景
前面是通用流程。落到测试这边,这三个场景是高频刚需:
场景 1:让 Agent 跑回归,自动汇总失败

场景 2:读测试报告,定位失败根因
给它一份 pytest / Allure 报告(或直接让它看报告目录),让它回答「哪些失败是真实缺陷、哪些是环境问题」。
场景 3:修复失败的测试脚本

这三个场景串起来,就是一个测试工程师版的「输入 → 中间产物 → 最终产出」闭环:下发任务 → 它跑 + 读 → 它修 + 复跑。
06进阶:用 Python SDK 嵌进 CI/CD
不想开网页、想把它嵌进流水线或自动化脚本,用 Python SDK:

环境变量:

注意:SDK 内置运行时,不依赖系统 Node.js。但示例 profile(`sdk-minimal`)默认是 `danger-full-access` 全权限,官方建议只在可丢弃的 checkout 或容器里跑,别直接怼生产。
07边界说清楚
适合的:
1)想低门槛体验「AI Agent 跑测试」的测试 / 开发
2)让 Agent 跑回归、读报告、改脚本这类机械活
3)有 DeepSeek 或任意 OpenAI 兼容端点的团队
不适合的(至少现阶段):
1)直接上生产关键路径 —— 开发者预览,会有 breaking changes
2)没有 API Key 只想白嫖 —— 框架免费,模型调用还是要花钱(虽然新模型更便宜)
3)想完全不看它干活 —— 写文件 / 危险命令需要你审批,这是安全设计,不是 bug
写在最后
AI Agent 不是程序员的专利。测试工程师手里最不缺的,就是「跑」字开头的重复劳动——而这类活,恰好是 Agent 最擅长接的。
`Deepseek-Harness` 的价值,不在于「又多了个工具」,而在于它把「让 AI 自己读、自己跑、自己改」这件事,做成了一个免费开源、5 分钟能跑起来的东西。门槛已经降到「装个 Node.js + 一行命令」。
先别想它能替代谁,先跑起来,让它帮你读一份 pytest 报告试试。
你第一次用 AI Agent,最想让它替你干的活是什么?评论区聊聊,我挑几个场景做成可以直接复制的 prompt 模板。