DeepSeek Harness 发布
TECH

DeepSeek Harness 发布

54+
Signals

战略概览

  • 01.
    2026 年 8 月 13 日,DeepSeek 推出了 DeepSeek Harness 开发者预览版(v0.1),并在发布 DeepSeek-V4-Pro-0813 正式版的同时,将源代码以 MIT 许可证形式公开。
  • 02.
    Harness 的核心设计理念是“一切皆为插件”——模型、工具、技能、会话、沙箱、存储、循环、调度以及用户界面,全部都是可替换、可重组的组件,没有需要修补的核心特权模块。
  • 03.
    Harness 基于 Cordis 构建,这是一个基于“时空可组合性”的 TypeScript 元框架——空间可组合性允许系统任何部分被挂载或替换而不破坏其余部分,而时间可组合性则支持可重放、持久的会话状态。
  • 04.
    Harness 提供四种运行模式:标准模式(完整代理)、代码/PTC 模式(程序化工具调用)、最小模式(基准测试和独立模型评估)以及创作者模式(自定义预设创作,最具实验性)。
  • 05.
    每次运行都可通过仅追加的会话日志实现完全可追溯,该日志记录系统提示、思维链推理、工具调用与结果、子代理调度以及每一次上下文注入,并可在“轨迹”视图中查看;会话可恢复、分叉、搜索和重放。
  • 06.
    Harness 是一个可通过 npm 安装的 Node.js 应用(npx @deepseek-ai/dsh web),默认在本地运行一个 Web 用户界面(http://127.0.0.1:3080),且与模型无关,支持 DeepSeek、Anthropic、OpenAI、AWS Bedrock、Microsoft Azure、Google Vertex/Gemini Enterprise 或任何兼容 OpenAI 的端点。
  • 07.
    GitHub 仓库在发布数小时内获得超过 33,000 颗星,截至研究日期已增长至约 113,700 颗星;该项目版本为 0.1.0-rc.5,并明确警告在 1.0 版本发布前将出现破坏兼容性的变更。
  • 08.
    DeepSeek-V4-Pro-0813 是 V4 Pro 的正式通用版本,一个拥有 1.6 万亿参数的模型,每 token 激活约 490 亿参数,预训练数据超过 32 万亿 token,上下文窗口达 1,048,576 个 token,最多可输出 384,000 个 token;与预览版相比,其在代理基准测试中表现大幅提升,例如 Terminal-Bench 2.1 从 72.1 提升至 87.9,DeepSWE 从 12.8 提升至 62.7。
  • 09.
    DeepSeek 于 2026 年 8 月 16 日起上调 V4 Pro API 价格,引入与北京时间挂钩的高峰/非高峰定价结构,高峰时段为 UTC 时间 1-4 时和 6-10 时。
  • 010.
    2026 年 8 月 15 日,腾讯 QQ Bot 平台宣布集成 DeepSeek Harness 官方插件(dsh-qqbot),新增独立的每会话记忆、会话中模型切换、群组“静默模式”(仅在被 @ 时响应)以及二维码零配置绑定功能。
  • 011.
    中国国家超算互联网平台于 2026 年 8 月 15 日上线 DeepSeek V4 Pro-0813 和 Harness 框架,支持在 10 万个加速器资源池上进行私有部署和分布式推理。
  • 012.
    DeepSeek 通过 LM Studio 提供的 Bionic 托管平台,在美国服务器上托管 V4 Flash 等 DeepSeek 模型,并默认启用零数据保留政策,这是与开源的 Harness 运行时本身不同的独立云托管服务。

一切皆为插件:Cordis 如何重构代理技术栈

Harness 的核心主张是架构层面的,而非营销口号:模型、工具、技能、会话、沙箱、存储、循环、调度,甚至用户界面,全部都是插件,没有需要修补的核心特权模块 [1]。这之所以可行,是因为 Harness 建立在 Cordis 之上,这是一个 TypeScript 元框架,其文档称之为“时空可组合性”——空间可组合性允许任何组件被挂载或替换而不破坏系统其余部分,而时间可组合性使会话状态可重放且持久,而非一次性记录 [2][3]。其实际收益是仅追加的会话日志:每一个系统提示、思维链步骤、工具调用、子代理交接和上下文注入都被记录,并可在“轨迹”视图中查看,会话可恢复、分叉和重放,而非每次都从零开始 [1][2]。这与默认隐藏推理轨迹的实验室形成鲜明对比——Harness 押注于代理决策路径的完全可审计性将成为开发者关注的功能,而非需要掩盖的负担。四种运行模式(标准、代码/PTC、最小、创作者)让开发者选择实际调用多少机制,从完整代理循环到孤立基准测试均可。

未被宣传的价格上涨

就在 Harness 免费开源的同一周,DeepSeek 悄然提高了在其内部运行模型的成本。自 2026 年 8 月 16 日起,V4 Pro 转为与北京时间挂钩的高峰/非高峰定价(高峰时段为 UTC 时间 1-4 时和 6-10 时),高峰时段输出成本较预览期最高上涨 4.6 倍 [4]。对代理构建者而言,最关键的细节是缓存定价:在新定价表中,缓存命中的成本涨幅最大 [4]。像 Harness 这样的代理框架正是围绕反复读取缓存上下文(如文件内容、代码库状态、长会话中的先前轮次)构建的,因此 Harness 旨在使其廉价高效的负载,恰恰是新定价惩罚最重的负载。DeepSeek 自家社区论坛的反应已聚焦于此:评论者称新定价下缓存命中成本突然上涨五到十倍。更尖锐的是,这种抱怨背后的张力尤为突出——同一群早期采用者分别报告在日常使用中前缀缓存命中率接近 100%,这意味着 Harness 的架构正在完美实现其设计目标,即推动大量缓存复用,而就在这一刻,DeepSeek 却使复用缓存成为代理所能做的最昂贵的事。免费提供运行时,同时提高其所依赖计算资源的计费成本,并非矛盾;这正是商业模式。

商品化互补品,而非鲸鱼

porus.dev 直言不讳地指出:‘没有运行时的开源权重就像没有神经系统的身体’ [5]。在 MIT 许可下开源 Harness 对 DeepSeek 成本极低,因为其下的模型仍为专有且调用成本更高——这是典型的“商品化你的互补品”策略,免费提供能将开发者锁定生态系统的层,同时对无法替代的层进行变现。36Kr 的分析进一步阐明为何 harness 层本身值得拥有,即使免费:与仅标准化工具连接方式的 MCP 不同,Harness 拥有实际运行代理的治理逻辑——在执行步骤前由谁批准、调用失败后如何重试、工作如何在子代理间分配、任务何时算完成——这一决策层决定了代理在生产环境中运行时的行为 [6]。这一布局并非临时起意。DeepSeek 于 2026 年 3 月从 Jane Street 招募了崔天宇(Cui Tianyu)专门领导此项目,在任何公开信号出现前数月即已启动,随后在 8 月中旬设立经验证的微信“Harness 团队”账号并发布招聘信息——明确表明 DeepSeek 有意作为产品公司与 Anthropic 的 Claude Code 竞争,而不仅仅是在基准排行榜上的模型供应商 [7][8]

病毒式数字,真实差距

生态系统数据确实庞大:GitHub 仓库在发布数小时内获得超过 33,000 颗星,随后增长至超过 113,000 颗 [10],而第三方插件项目在测试版发布后数日内注册达 712 个,涵盖代理框架、编码代理和记忆工具 [9]。但在这些亮眼数据之下,仍存在多条质疑声。独立开发者评论指出,插件数量增长本身无法解决相同的未解瓶颈——长周期任务执行、代理记忆以及安全与沙箱——有开发者认为,记忆只有在与推理集成时才能良好工作,而非作为另一个可替换插件简单附加 [9]。DeepSeek 自家社区论坛的早期实测用户从另一角度补充了具体细节:目前尚无命令行界面,仅有桌面 GUI,因此任何需要 CLI 的用户目前都需自行基于 MIT 许可的源码构建;而驱动更复杂工作流的子代理系统在此预发布版本中仍存在足够多的 bug,以至于一些早期采用者表示,他们将暂时维持现有 harness,直到其稳定。此外,X 平台上多个无关账户中传播着大量内容几乎相同的推广帖(“我取消了每月 200 美元的计划,改用 DeepSeek Harness”),其模板化模式读起来更像是协调的增长黑客行为,而非自然反应。在社区论坛上,一些评论者也提出了相关怀疑,认为 GitHub 星标数本身可能部分被夸大,而非对自然采用的准确反映。发布是真实的,架构是实质性的;但所报告的热情规模比表面看起来更嘈杂,数字与日常体验之间的差距仍然巨大。

历史背景

DeepSeek 在公开发布前数月,聘请前 Jane Street 工程师崔天宇(Cui Tianyu)领导 harness 项目。
DeepSeek 在 8 月 13 日正式发布 V4-Pro-0813 前,推出了其旗舰 AI 模型的公开测试版 API,即 V4 Pro 的预览版本。
DeepSeek 的 harness 负责人呼吁开源代理框架开发者报名参与测试;三天内注册项目达 712 个。
DeepSeek 暂停的 80 亿美元融资轮重新启动,估值接近 740 亿美元。
DeepSeek 公开设立其 Harness 团队的认证微信账号并发布招聘信息,表明其有意挑战 Anthropic 的 Claude Code。
DeepSeek Harness v0.1 开发者预览版发布,并以 MIT 许可证开源,同时发布正式版 DeepSeek-V4-Pro-0813。
腾讯 QQ Bot 宣布集成 Harness 插件(dsh-qqbot),国家超算互联网平台上线 V4 Pro-0813 和 Harness,支持私有部署。
新的高峰/非高峰 V4 Pro API 定价生效,高峰时段输出 token 成本较预览期最高上涨 4.6 倍。

关键关系图

关键玩家
主题

DeepSeek Harness 发布

DE

DeepSeek AI

《DeepSeek Harness》和《DeepSeek-V4-Pro-0813》的创建者和发布者;以MIT许可证开源了Harness,并成立了专门的“DeepSeek Harness团队”,采用独立品牌标识(黑色鲸鱼标志,区别于模型所用的蓝色鲸鱼标志)。

CU

Cui Tianyu (also referenced as Cui Tianyi)

前Jane Street工程师,2026年3月被DeepSeek聘用以领导Harness项目;曾公开呼吁开源代理测试框架开发者加入其测试计划。

AN

Anthropic (Claude Code)

作为Harness在代理测试框架和编程代理产品类别中主要的现有竞争对手。

TE

Tencent (QQ Bot platform, WeChat)

腾讯的QQ Bot平台于2026年8月15日正式集成了DeepSeek Harness插件(dsh-qqbot);此外,DeepSeek的Harness团队还设立了认证的微信公众号以招募工程师。

LM

LM Studio / Bionic

通过其位于美国、实行零数据保留政策的Bionic云托管平台托管DeepSeek V4 Flash等模型,是Harness发布时提及的早期第三方托管集成方之一。

CH

China's National Supercomputing Internet

与国家相关的超级计算平台,于2026年8月15日为DeepSeek V4 Pro-0813和Harness提供私有部署及分布式推理支持。

OP

Open-source plugin developer community

截至2026年8月4日(发布测试招募呼吁三天后),已有712个外部项目注册加入Harness插件生态测试计划,涵盖代理框架、编程代理、记忆与上下文工具,以及小型研究/评估和安全治理类别。

事实来源

10 条引用
  1. [1] DeepSeek Harness official product page
  2. [2] DeepSeek's innovative Harness treats everything as a plug-in - The Register
  3. [3] Cordis tutorial - deepseek-harness GitHub docs
  4. [4] DeepSeek launches an improved V4 Pro model, raises API prices, and makes its agent software open source - The Decoder
  5. [5] porus.dev analysis of DeepSeek V4 Pro and Harness
  6. [6] 36Kr 'Black Whale' analysis of DeepSeek Harness
  7. [7] DeepSeek Harness launches as open-source rival to Claude Code - VentureBeat
  8. [8] DeepSeek publicizes efforts to challenge Anthropic's Claude Code - Bloomberg
  9. [9] BigGo Finance coverage of the DeepSeek Harness plugin ecosystem
  10. [10] deepseek-ai/deepseek-harness GitHub repository

来源文章

Top 5

THE SIGNAL.

Analysts

认为 DeepSeek 正在刻意‘商品化其互补品’,通过免费提供 harness 使其成为其他开发者构建的基础层,类似于开源权重本身如何被商品化。

porus.dev analyst (unnamed byline)
porus.dev 博客作者

区分 Harness 与 MCP:MCP 标准化工具连接,而 Harness 控制操作逻辑——审批流程、重试策略、子任务调度和终止条件——将其置于决定模型如何执行现实任务的关键层。

36Kr analysis (eu.36kr.com, 'Black Whale' piece)
36Kr 科技组

将 Harness 的发布视为行业从模型智能竞争转向代理连接性竞争的更广泛趋势的一部分。

VentureBeat reporting
VentureBeat 科技组

指出早期 Harness 插件生态系统面临的三大技术瓶颈:长周期任务执行、记忆以及安全(工具权限、沙箱);认为良好的记忆实现需要记忆与推理的集成。

Developer 'baboonAI4S'
独立开发者,经 BigGo Finance 引述
The Crowd

i replaced Codex with a GitHub repo that hit 88,000 stars in its first 24 hours... it's called DeepSeek Harness. then someone figured out how to never hit Codex usage limits again. [took me 5 mins to set up... this is fucking gold. here's how] 1. install codex-router 2. one...

@@Av1dlive202

this can't be allowed i dropped my $200/mo Claude plan for deepseek harness and it feels like it costs nothing it runs on a single obsession: plugins all the way down [setup is a 3 minute speedrun, here's the playbook] 1. grab the repo called deepseek harness 2. skim the...

@@cyrilXBT148

DeepSeek open-sourced their agent harness yesterday. We spent the morning taking it apart and built an explainer site: plain language, three depth levels, from "how do I run this" down to the 88-page paper underneath. EN: https://t.co/G8kLYxchgp ES: https://t.co/pHp3stsRjW

@@helmcode33

Deepseek Harness is Up!

@u/Fun-Doctor6855312
Broadcast
DeepSeek Harness: The End of Claude Code?

DeepSeek Harness: The End of Claude Code?

DeepSeek Harness 正式发布!开源一天狂揽 6.8 万星!V4 Pro 模型低调上线,AI Agent 部署与实测 | 零度解说

DeepSeek Harness 正式发布!开源一天狂揽 6.8 万星!V4 Pro 模型低调上线,AI Agent 部署与实测 | 零度解说

🚀实测DeepSeek Harness从基础到高级用法!WebUI远程控制、多模型接入、执行轨迹、插件系统、任务分支、游戏开发、代码仓库issues和pr分析!竟然比Claude Code更强?

🚀实测DeepSeek Harness从基础到高级用法!WebUI远程控制、多模型接入、执行轨迹、插件系统、任务分支、游戏开发、代码仓库issues和pr分析!竟然比Claude Code更强?