月鹿手记
Harness 实测 · 2026年08月14日
DeepSeek 昨天开源了一个东西,叫 Harness。
跟 V4 模型一起上线的,但它不是模型。是一个让模型能读文件、跑命令、用工具、做任务的工作台——跟 Claude Code、Codex 是同一类东西。
我昨晚装上就开始跑,四种模式全测了一遍,顺手验了一下我在 Codex 里积累的 Skill 能不能直接搬过来。
结论先放这:能用,有新意,但现阶段不适合替代你手上已经跑通的工具。
01
它到底是什么
WHAT IS IT
模型决定它聪不聪明,Harness 决定它能不能把事情做完。
普通模型只能聊天。Harness 给模型接上了文件读写、命令行、网页搜索、权限管控和各种技能包,让它能真的动手干活。
跟 Claude Code 和 Codex 的区别不在于用了 DeepSeek 的模型——区别在于它把工作台本身拆成了 139 个插件,而且让你连 Agent 都能自己重新组装。
打开插件列表的时候我愣了一下——会话、沙箱、权限、终端、界面按钮,全是独立模块。连"模型选择"这个下拉框都是一个插件。

底层用了一个叫 Cordis 的插件框架。大白话讲:如果把 Harness 比作一台机器,Cordis 就是它的插槽和拆装规则。工具、提示词、权限,都是可以装上去、换下来的零件。
02
四种模式,同一道题
FOUR MODES
为了公平对比,我给标准、PTC、极简三种模式出了同一道题:只读审查我的第 48 篇公众号项目,盘点素材、找事实冲突、列证据缺口。同一个工作区,同一个权限,同一个模型(DeepSeek-V4-Pro High),只换模式。

结果挺有意思:
标准模式——12 步,约 5 分钟跑完。能准确识别文件之间的事实冲突,发现我初稿里把没发布的文章写成了"已发布",还指出测试计划和实际执行不一致。最均衡的一个。
PTC 模式——13 步,约 4 分半。官方说法是让模型先写一小段程序,把好几步操作打包成一次执行,理论上更快。实测下来比标准快了 10%,还多发现了一处商单目录缺失。但上下文消耗反而多了 17%,没有明显"更省"的感觉。

极简模式——63 步,将近 14 分钟。只给两个工具:一个终端,一个文本编辑器。
这个模式最出乎意料。
标准和 PTC 都因为当前模型不支持看图,4 次读取截图全部失败。极简模式呢?它自己在命令行里编了一个小程序,调 macOS 自带的文字识别能力,硬是把 9 张截图里的文字全读出来了。
还不止——它翻到了本地存的原始会话记录,找到 PTC 模式确实生成过打包程序的证据,补上了我在前两种模式里没拿到的信息。
代价是 280 万字的上下文消耗,标准模式的 7.5 倍。
标准模式最省心,PTC 快一点但不更省,极简模式能力没上限但烧钱。
指标 | 标准 | PTC | 极简 |
|---|---|---|---|
步数 | 12 | 13 | 63 |
LLM 时间 | 4分55秒 | 4分25秒 | 7分31秒 |
工具时间 | 4.2秒 | 4.7秒 | 6分27秒 |
输入 | 37.2万 | 43.5万 | 280万 |
输出 | 2.04万 | 1.95万 | 3.1万 |
首 token | 3秒 | 2.1秒 | 1.9秒 |
生成速度 | 79 tok/s | 82 tok/s | 94 tok/s |
03
创造模式:让 Agent 造 Agent
CREATE MODE
第四种模式不参加速度赛。它干的事不一样——帮你组装一个新的 Agent。
我让它创建一个"公众号素材整理 Agent":能读项目里的链接、截图说明和对话记录,整理出素材清单、事实边界、可写角度和缺口;没确认之前不准写正文,不准删文件。
9 分钟后,一个新的自定义 Agent 出现在模式选择列表里。

我新建会话选了这个自定义 Agent,随口说了句"帮我看看第 46 篇选题有哪些素材"。它翻了公众号文件夹里 18 篇历史文章,找出跟选题相关的材料,按四份清单输出,最后停下来等我确认。
没直接写正文。规则守住了。
但它也越界了——我只说了看公众号文件夹,它顺手翻了商单目录,里面有客户名、金额和联系方式。
第二次我明确给了目录白名单:"只许看公众号目录,其他的先问我。"这次它老实了。上下文消耗从 140 万降到 30 万,步骤从 21 降到 8。
Agent 的边界不是天生有的,是你画出来的。画清楚了,它比你想的听话;没画,它比你想的野。
04
子 Agent 并行:一个任务拆给三个人干
SUB-AGENTS
这是我觉得最能体现 Harness 价值的一轮测试。
我让它用只读权限审查一个网页项目,但不是一个 Agent 从头干到尾——而是拆成三个子 Agent 并行:一个做产品体验,一个做交互设计审查,一个做源码落地审查。最后由主 Agent 汇总。

结果:三个子 Agent 各跑各的,主 Agent 还发现了两个子 Agent 的计算错误并纠正。最终十项建议都落到了复现步骤、源码行号和工期。
但也有两个问题:
1. 它没有真实浏览器,桌面端和手机端体验主要是通过代码和 CSS 推演的,不能写成"亲自在手机上完整操作过"。
2. Read Only 只保护本地文件。有一个子 Agent 向外部网站提交了一次真实的研究任务——权限管的是本地读写,管不住网络请求。
最终数据:4 轮、49 步、22 分 33 秒、输入 410 万、输出 7.01 万。
效果确实深,但成本和自主行动风险也很明显。权限画的是本地边界,网络请求它目前不拦。

05
我的 Skill 能不能搬过来
SKILL MIGRATION
这是我最关心的问题。我在 Codex 里积累了 46 个 Skill——写作风格、去 AI 味、配图、排版、淘 GitHub 资源。Skill 就是提前写好的工作规则,像给 AI 准备的岗位说明书。如果换一个工具就得从头来,那不值。
拿 humanizer(我的去 AI 味 Skill)试了一下。
Harness 在标准模式下先扫描了我项目里的技能包目录,找到了 humanizer 的规则文件,加载完整规则,然后按规则改写了一段测试文字。
输出格式对了——Draft rewrite、自检、Final rewrite、Changes made,四个部分齐全。"里程碑意义""全面赋能""引领行业""无限潜力"这些 AI 腔全砍了。

纯文字规则型的 Skill 可以直接迁移。 Harness 找 Skill 的方式跟 Codex 不完全一样,但项目里放好规则文件它就能认。
不能迁移的:需要调用特定工具接口、浏览器操作或外部服务的 Skill。比如我的公众号排版工具要调微信 API 推草稿箱,这个在 Harness 里得重新接。
06
和 Claude Code、Codex 到底什么区别
COMPARISON
三个工具都是"让 AI 动手干活的工作台",但思路不一样。
Claude Code 像一间装修好的工作室。打开就能干活,你不会想拆它的墙。
Codex 像一间能加装备的工作室。流程是现成的,你往里加技能包和外部工具就行,底层怎么跑的不用管。
DeepSeek Harness 不太一样——它把线路图和插槽都摊在桌上给你看。不光让你用,还让你看清这东西是怎么拼的,然后鼓励你自己拼一个新的。
Claude Code 和 Codex 帮你把项目做好。Harness 连 Agent 本身都想让你拆开重来。

07
能不能替代我现在用的工具
REPLACEMENT?
我测完之后第一反应也是这个——要不要切过来?
想了想,不行,至少现在不行。四个原因:
1. 它是开发者预览。官方原话就写着"后续会有破坏兼容性的更新"。今天搭好的东西,下个版本可能直接废了。你不会把正在赚钱的工具换成一个随时会大改的东西。
2. 本地启动,关终端就没了。不是云服务,不是 App。跑一个本地网页,电脑休眠、终端一关,服务就断。我测试期间就遇到一次——第二天打开浏览器,页面直接拒绝连接,重新跑命令才恢复。
3. 模型不能看图。当前 DeepSeek-V4-Pro High 不支持图片输入。截图验证、界面检查、配图审核这些日常操作全做不了。标准和 PTC 模式读截图全失败,只有极简模式自己编了个 OCR 硬读。

4. 技能包搬不完。纯文字规则能迁移,但需要调用外部服务的都得重新接——比如我的公众号排版推草稿箱、配图生成。等于要重建半条工作流。
简单讲:它能做的事,我手上的工具已经能做了,还更稳。它多出来的能力——自己拼 Agent——现阶段用不上或者成本太高。
08
小白能不能用
FOR BEGINNERS?
不能。至少现在不能。
装它要先有 Node.js 22 以上版本,在命令行里启动。界面是英文,配置要理解插件、权限、模式这些概念。没有"打开就能聊"的体验,出问题只能去 GitHub 提问。139 个插件摆在那里,普通人看到会懵。
对比一下门槛:Claude Code 打开终端就能跑,Codex 有网页界面和 IDE 插件,WorkBuddy 在微信里发条消息就行。Harness 比这三个都高一截。
它现在面向的人很明确:对 Agent 架构好奇的开发者,或者想自己从零搭一个专属 AI 助手的人。如果你只是想让 AI 帮你干活,不需要知道它内部怎么拼的,现阶段用成熟工具更省心。
∞
写在最后
FINAL THOUGHTS
说了一堆"不行",但我确实觉得这个方向有意思。
Claude Code 和 Codex 帮你用 Agent 改项目。Harness 想的是——连 Agent 本身都让你拆开、重组、改造。
不是"用了 DeepSeek 模型"这层区别。是"把 Agent 的组装过程变成了你能操作的东西"。
如果你对"AI 助手到底是怎么工作的"好奇,或者你想给自己的业务做一个专属的 AI 助手——不是用别人的模板,是从零组合工具、权限、Skill 和提示词——这个东西值得花半天看看。
以前挑 AI 工具,看的是谁更聪明。
现在多了一个维度——谁让你自己也能动手搭。
往远了想,如果这条路走通了,普通人可能不再只是"用别人做好的 AI 产品"。而是把自己的工作方法、行业规则、审核标准做成 Skill,再组合出一个只替自己干活的助手。
写作的人有写作 Agent,做电商的人有选品 Agent,做财务的人有审计 Agent——不是通用的,是按你自己的规矩来的。
现在还早,这些都还只是可能性。但至少有人把底层打开给你看了。
两种安装方式:
最简单的——装好 Node.js,一行命令:
npx @deepseek-ai/dsh web
想看源码或者自己改的:
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web
两种方式都会在本地启动 Web UI,默认地址 http://127.0.0.1:3080。
相关地址:
DeepSeek Harness:github.com/deepseek-ai/deepseek-harness
Cordis 框架:github.com/cordiverse/cordis
Cordis 论文:github.com/cordiverse/paper
测试环境:macOS,Node v22.17.0,模型固定 DeepSeek-V4-Pro High,本地 127.0.0.1:3080。全部测试跑下来大约花了 5 块钱。