2026 年 8 月 13 日,DeepSeek 做了两件事:发布 V4 Pro 正式版,开源 Harness。
一天之内,Harness 的 GitHub 仓库冲到 8 万 Star。两天后,这个数字逼近 95k。1.5 小时破 2.4 万 Star 的瞬间,直接刷新了 GitHub 史上最快涨星纪录。
不是营销砸出来的,不是 KOL 刷出来的。开发者用脚投了票。
先搞清楚:Harness 是什么
DeepSeek 官网放了一条公式:
Agent = Model + Harness
模型是灵魂,Harness 是骨架。模型负责推理,Harness 让 Agent 能看懂环境、用工具、在真实场景里持续工作。
你用过的 Claude Code、Cursor、Codex,背后都有一个 Harness——只不过它们的 Harness 是锁死的,和自家模型深度绑定。DeepSeek 把这层骨架拆出来开源了,而且每一块都能换。
核心:一切皆插件
这是 Harness 最狠的设计。
模型、工具、技能、会话、沙箱、存储、循环、调度、UI——所有 Agent 能力,全是插件。基于 Cordis 插件系统构建,没有特权核心,不需要改源码,配置文件里选、换、扩展都行。
想用 DeepSeek V4?插件。想换 Claude?插件。GPT?Gemini?AWS Bedrock?Azure?全是插件。Harness 甚至能读 Claude Code 的 CLAUDE.md 和 Codex 的 hooks.json,把它们当子 Agent 调度。
这意味着什么? 模型和基础设施彻底解耦。一个团队用 Claude 做复杂任务,用便宜模型跑日常活,不用换工具链。想横向对比几个模型?同一个 Harness 跑不同 Provider,直接比。
四种运行模式
Harness 不是只能跑一种 Agent。它有四个预设:
Standard:全功能编码 Agent。文件编辑、Shell、网页搜索、技能、规划、子 Agent、工作流,全开。
Code:在 Standard 基础上,把工具暴露成 TypeScript SDK。模型可以写一段程序,把多步工具调用编排成一次往返——降延迟,省 Token。
Minimal:只留 bash 和文件编辑器两个工具。给模型跑 Benchmark 用的,最干净的环境。
Creator:检查当前运行时,内存里测插件,组合出新模式。给想造自己 Agent 预设的人用的。
每一步都可追溯
这是 Harness 和大多数竞品拉开差距的地方。
模型看到的一切——系统提示词、思维链、工具调用和结果、子 Agent 调度、每次上下文注入——全部写进只追加的会话日志。上下文压缩不删原始历史,只是用替换事件改变模型后续看到的表象。
Trajectory 视图里按来源逐条追。恢复、分叉、搜索、回放,全操作在同一条事件流上。
Agent 做了件 unexpected 的事?不用猜,拉日志看它当时看到了什么、为什么做了那个选择。Debug 和 Guess 之间的区别,就在这里。
沙箱:用操作系统级别的隔离
Agent 跑模型生成的任意命令,沙箱不是可选项。
Harness 在 Linux 上用 Landlock,macOS 上用 Seatbelt,Windows 上用 ACL 受限令牌。这些都是操作系统级的容器机制,和浏览器隔离不可信代码是同一类技术。
不是 Docker 套一层,不是进程级限制凑数。很多 Agent 工具在这块是偷懒的,Harness 没有。
为什么两天 95k Star
不是单一原因。是几个因素叠在一起:
模型无关。开源 Agent 框架最大的吸引力就是不被锁死在某家模型上。Harness 把模型也做成了插件,这在当前 Agent 工具里几乎没有第二家做到这个程度。
Cordis 架构。和北大 researchers 合作的"时空可组合性元框架"。学术 + 工业的合作,在基础设施层做了真正的创新,不是拿个开源框架套壳。
DeepSeek 品牌势能。V4 Pro 同日发布,DeepSeek 在开发者社区已经积累了大量信任。性价比屠榜之后,开发者愿意试它的基础设施产品。
一行命令启动。npx @deepseek-ai/dsh web,装好 Node.js 就能跑。没有环境配置地狱。
社区插件生态自发生长。开源几小时,dsh-plugin 话题下已经有 307+ 个公开仓库。这速度说明开发者不是来看热闹的,是真的在动手造。
12,000+ commits。这不是一个 PPT 项目。仓库带着超过 1.2 万次提交、230 多个 workspace 成员,说明内部已经迭代了很久,拿出来的是成熟度相当高的东西。
和其他工具对比
维度 | DeepSeek Harness | Claude Code | OpenAI Codex | LangChain | LangGraph |
|---|---|---|---|---|---|
定位 | Agent Harness | 集成产品 | 集成产品 | Agent 框架 | Agent 运行时 |
模型锁定 | 无(全插件) | Claude | GPT | 无 | 无 |
开源 | MIT | 否 | 否 | MIT | MIT |
插件系统 | 一切皆插件 | 无 | 无 | 组件级 | 节点/边 |
可追溯性 | 完整(append-only) | 有限 | 有限 | 手动 | 手动 |
沙箱 | OS 级 | 不公开 | 不公开 | 无 | 无 |
控制粒度 | 中(配置组合) | 低(开箱即用) | 低(开箱即用) | 中 | 高(最细粒度) |
适合场景 | 基础设施 | 即用编码 | 即用编码 | 快速原型 | 生产级工作流 |
关键区别:Claude Code 和 Codex 是成品,开箱即用但什么都锁死。LangChain 和 LangGraph 给你积木,但 Harness 的活要自己搭。DeepSeek Harness 在中间——给你一个能跑的 Agent,但每个零件都能换。
LangChain 官方自己把这三个层次叫做:Runtime(LangGraph,最控制最少抽象)→ Framework(LangChain)→ Harness(Deep Agents,最少控制最开箱即用)。DeepSeek Harness 做的是同样的 Harness 层,但比 LangChain 自家的 Deep Agents 走得更极端——连模型和 Agent 主循环都是插件。
还不能忽视的问题
不接受外部 PR。README 明确写了:"We are sorry that we cannot accept external pull requests at the moment." 开源了代码,但治理还没开放。贡献者只能去 GitHub Discussions 发插件。
MIT 协议但治理不开放,这是个张力。对于一个主打"模块化、反锁定"的项目来说,尤其值得观察。
Developer Preview。核心插件和 API 还会变。现在上生产环境需要做好跟着 breaking change 走的准备。
这意味着什么
DeepSeek 在赌一件事:基础设施层的价值会超过模型层。
模型越来越便宜,差距在缩小。今天 V4 Pro 和 Claude 4.5 各有胜负,明天可能更多模型追上来。如果模型变成大宗商品,那让 Agent 跑起来的基础设施就是价值锚点。
Harness 能用竞争对手的模型,甚至能把 Claude Code 和 Codex 当子 Agent 调度。这不是做慈善——这是在说:不管你用谁的模型,你的 Agent 基础设施都可以跑在我上面。
这个赌注能不能赢,还太早说。但两天 95k Star 说明一件事:开发者受够了被锁定。
DeepSeek Harness 官网:deepseek.com/harness GitHub 仓库:github.com/deepseek-ai/deepseek-harness
