一切皆插件,DSH在“自进化”之路上狂飙
摘要
千呼万唤始出来,DeepSeek V4 Pro正式版和传说中的DeepSeek Harness(DSH)终于问世了。 说起DSH这个产品,它曾于8月1日开始招募内测。招募采取筛选制,优先吸纳具备大型项目开发、AI Agent二次开发经验的工程师,...
千呼万唤始出来,DeepSeek V4 Pro正式版和传说中的DeepSeek Harness(DSH)终于问世了。
说起DSH这个产品,它曾于8月1日开始招募内测。招募采取筛选制,优先吸纳具备大型项目开发、AI Agent二次开发经验的工程师,申请人需要提交代码托管平台账号和过往项目代表作品,入选者还要签署保密协议。

现在终于算是见到了DSH的庐山真面目。经过字母AI一晚上的测试,结论是这个产品性能很好、响应速度快,关键是还非常省token。
只能说,还得是DeepSeek,老配方老味道!
再看V4 Pro正式版这边,虽然8月13日时,由于DeepSeek修改了API文件的表述,以及在DeepSeek官网增加公告,导致8月13日上午,全网都在热传V4 Pro正式版已经发布。
可事实上,此次发布实则为一场乌龙,所谓的DeepSeek V4 Pro正式版不仅性能堪忧,而且价格还保持着此前的价格不变。
8月13日下午,DeepSeek官方撤下了首页关于DeepSeek V4 Pro正式版发布的公告。
而8月13日晚间发布的,才是真正的DeepSeek V4 Pro正式版。
Agent能力大幅提升。DeepSWE从预览版的12.8分直接飙到62.7分,涨幅接近五倍;DSBench-Hard从31.1冲到 67.2;DSBench-FullStack从41.8提升到71.1。尤其是在Agent领域影响力最大的基准Terminal Bench 2.1上,DeepSeek V4 Pro正式版性能比肩当下最强的Claude Fable 5。

话又说回来了,虽然此前DeepSeek公告称价格上调,但谁也没想到涨价涨得这么多。
输出方面,高峰时段价格为原价的4.5倍,为27元/百万token,空闲时段为原价的2.25倍,为13.5元/百万token。以单日20万输出token的代码审查场景为例,调价前单日成本约1.2元,高峰时段将升至5.4元,空闲时段升至2.7元。

缓存未命中输入方面,高峰时段为原价的3倍,为9元/百万token,空闲时段为原价的1.5倍,为4.5元/百万token。缓存命中输入方面,高峰涨幅最高,达到原价的12倍,为0.3元/百万token,空闲时段为原价的6倍,为0.15元/百万token。
无论如何,不妨先来一起看一下这个产品。
01
它不是下一个Codex,
它是第一个DSH
应了梁文锋那句“我们不在乎C端”,DSH的安装门槛非常高,不仅要有node.js环境,还需要用户自己去GitHub上面用npm命令安装。像是Codex、Workbuddy这样的Harness,都是可以直接双击安装的。
之所以有安装门槛,是因为DSH既不是桌面GUI,也不是TUI、CLI,而是走了一条几乎没人走过的路,DSH是BS架构的Web UI,打开就是个网页,网页里带一块Agent干活的区域。
要理解DSH为什么这么“反用户”,就得先理解支撑它的那篇论文《A Programming Paradigm for Spatiotemporal Composability》,由北京大学和DeepSeek联合署名。
DSH的思路叫做一切皆插件,任务需要什么,就调用什么插件,用完立马卸载腾空间。
打个比方,Claude Code是一辆车,你可以给它装上装甲、防滑胎甚至是武器,但它归根结底就是一辆车。Codex同样是一辆车,可你只能给它改改内饰和车漆。DSH只是一个底盘,你可以给它加轮子让它变成车,但你同样可以给它加螺旋桨让它变成直升机。

为了满足这个核心设计理念,论文提出了两个维度。
第一个维度叫时间可组合性。意思是,当一个组件被移除时,它对共享环境造成的所有修改,必须能被完全、安全地撤销。
论文引用了“效应”这个概念,传统的效应指的是一个程序在跑出结果之外,还会动手改变外面的世界,比如创建了一个文件,那么磁盘里就会记录这个文件的内容。
DSH是把运行办法、撤销办法全都记录在了效应之中,还专门给它起了个名字,叫做可逆效应。
这个很好理解,经典“效应”像是你买东西时收银台给你开的小票,它只记录你买了什么,如果你想退货,你还得走一些程序。而DSH论文中的可逆效应,就像是你在胖东来买东西,你退货的时候不需要走程序,直接把商品交给客服,剩下的他们(系统)会替你解决。
每一次上下文变换都自带一个逆变换,运行时全程追踪,组件卸载时自动回滚。
第二个维度叫空间可组合性。
这是一种运行时的组件组合模型。和传统的静态依赖注入不同,组件的依赖关系不是在代码编写时或启动时固定的,而是在一个共享的运行时“空间”中动态建立、动态消解的。
举个例子,假如说你想让DSH给你念一本书。DSH上有视觉相关的插件,它可以充当眼睛,把书的内容记录下来,但是它没办法念出声。同时DSH还有声音相关的插件,它只会读却不会记。将视觉插件和声音插件放在同一个空间内,它们就会自动关联,视觉插件负责把记录的文字给声音插件,声音插件再将其读出来。
论文里拿VS Code当反例,VS Code的扩展全部跑在一个共享进程里,装了就不能热卸载,想停用一个带代码的扩展,就得重启整个扩展宿主。
按论文统计,安装量前100的扩展里,有87个包含可执行代码,都得靠重启来卸载。
可是一旦重启,进程内积累的缓存、连接、部分计算结果全部作废,重建要花上几秒到几分钟;为了维持可用性,还得养冗余副本,以供重启之后Vs Code调用。
DSH采用了一套Cordis系统,实现了热模块替换,改完插件直接原地替换,缓存和活动连接都给你留着,改炸了还能事务性回滚。
但DSH真正让人惊艳的,并不在这套理论本身,而是它把理论用在了哪里。
DSH定义了四套完全不同的执行模式:普通任务直接做;长程任务进入Goal,可以跨多个自主轮次(autonomous rounds)持续执行;一两个任务可以丢给子Agent,默认后台运行;大规模并行任务进入Workflow,用一段JavaScript去编排多个 Agent。
小事,比如“帮我把这个文件改一下”,AI直接上手就干,不搞流程、不折腾。
大事,比如“给我写一个完整项目”,可能得干好几个小时。为了防止过程中出错,所以DSH给它定制一个“总目标”,让它能连续干好多轮,直到目标达成才收工。就像带了个KPI,没完成不许下班。
为了能更好地完成任务,DSH甚至还有一个单独的Ralph Loop,每一轮都创建一个完全“失忆”的新Agent,不继承上一轮对话,只通过共享的Workspace保留长期记忆,然后一轮轮迭代。
DSH也是为了AI自进化设计的。
插件化意味着架构解耦,任何模块都可以独立演化;AI注意力受限,又是大规模并发,解耦设计能最大限度发挥这种高并发优势,还避免了把自己搞崩溃的问题。
传统软件里,模块之间经常“你中有我,我中有你”。改一个地方,可能连带弄坏十个地方。
插件化就不一样,每个功能都是一个独立的插件,只通过一个标准接口跟系统相连。插件之间不直接认识、不互相扯皮。
正因为这样,任何一个插件都能单独升级、单独替换、单独进化,不用动其他插件。
假如按照传统模块A干活必须等模块B先干完,那大家排着队,互相干等。但解耦之后,每个模块都是独立的,谁也不挡谁的路,几十个任务可以同时撒出去跑,互不干扰。
AI注意力有限没关系,因为每个模块是独立的小任务,AI分头指挥、同时推进,效率拉满。
02
实际效果
我给DSH和DeepSeek V4 Pro正式版准备了三道题,并且让Claude Fable 5和Claude Code作为它的对手。
第一题,经典的鹈鹕测试。提示词为
生成一个循环动画SVG:鹈鹕骑自行车。轮子旋转、踏板转动、鹈鹕的腿正确踩踏板,平滑无限循环,不要JS,只用SVG原生animateTransform动画。
DSH
DeepSeek 鹈鹕

Claude
Fable 5 鹈鹕

在这道题的表现中,Fable 5设计的形象更加合理,并且地面上的公路会不断向后退。DeepSeek生成的演示动画里,虽然天上的云彩也会向后退,但是地上的草地没有变化,不够细节。因此这道题是Fable 5胜出。
第二题,俄罗斯方块小游戏。提示词为
要求:
一个 HTML 文件,Canvas 或 DOM 实现都行
完整的俄罗斯方块:7 种方块、旋转、左右移动、加速下落、消行、计分、下一个方块预览
游戏结束判定,按 R 可以重新开始
不允许用任何游戏引擎
DSH
DeepSeek 俄罗斯方块

Claude
Fable 5 俄罗斯方块

这题两者表现差不多,不过实际玩起来感觉DSH做的手感更好一些,Fable 5做出来的手感略微有些僵硬。
第三题,曼德博集合。提示词为
一个 HTML 文件,用 Canvas 实现
实现曼德博集合(Mandelbrot Set)的可视化
鼠标滚轮可以放大缩小,点击可以平移
颜色用渐变,放大后细节要清晰
不允许用任何外部库
DSH
DeepSeek 曼德博集合

Claude
Fable 5 曼德博集合

曼德博集合是数学里最著名的分形图案,把边缘任意一小块放大,会看到和整体形状相似的“小曼德博”,再放大还有更小的,可以无限下去,永远有新细节。
Fable 5生成的结果最大只能渲染到100倍,而DSH可以渲染超过300倍,因此这一轮是DSH胜出。
03
同样的任务,便宜120倍
相同的任务,差不多的效果,Fable 5一共花了9.8美金的token,约合人民币将近70块钱。用DSH配上DeepSeek V4 Pro 正式版跑,只花了5毛9分钱人民币。
此前根据Artificial Analysis的测算,DeepSeek V4 Flash正式版在相同的任务条件下,比Claude Fable 5便宜了约100倍。
但V4 Flash毕竟只是个轻量模型,并不能完成复杂任务。这次随着V4 Pro正式版以及DSH的组合,已经比Claude Fable 5便宜将近120倍了。
Artificial Analysis曾预测,随着DeepSeek V4 Pro正式版发布,DeepSeek斩杀线将会覆盖全球超过70%的模型。现在看来Artificial Analysis预测的非常准确。
不过我也得“唱个反调”,由于我测试的时间段属于非高峰时间段,所以token价格相对便宜,如果换做高峰时间段,那么V4 Pro正式版的token费用将比Fable 5便宜不到100倍。
在我测试的过程中发现,DSH的缓存命中率能高到离谱,有时候甚至能高到99%。
要知道,无论是高峰还是非高峰,命中缓存都比非命中缓存便宜整30倍。
除了前文提到的热替换和可逆效应以外,还有一点就是论文里的“增量协调”(Incremental Reconciliation)。
配置层是一棵由“档案卡”(entry)组成的树,每张档案卡声明一个插件,里面的信息包括它叫什么、跑哪份代码、带什么配置。
传统做法是,档案一改,就把对应的整个实例连根拔起、全部重来。
增量协调不是这样。它先看改动落在档案卡的哪一格,再做最小动作,只有代码地址变了,才重建整个实例。如果只是隔离方式变了,那就单独调一下隔离域。如果改的是配置本身,就交给插件自己比对,只有真动到实质内容才重载。标成停用就卸掉,取消停用再装回来。插件底下还挂着子插件的话,就按各自的编号“按名对账”:新增的装进来、删掉的卸下去、没动的原样留着,一层层递归下去。
这样一路修补下来的最终状态,和把整个系统推倒重建再加载的最终状态完全一致。
用人话说,就是改东西的时候只动该动的,没动的原地继续干活,而且最终效果跟全部推倒重来一模一样。
在以前,把宫保鸡丁变成宫保鸡丁(微辣),需要将整个餐馆停业,重新培训厨子、服务员和大堂经理。然而这样显然是浪费算力,增量协调相当于是检查一下宫保鸡丁(微辣)的菜谱,发现好像只要撒一点辣椒进去就可以了,于是就让所有流程保持不变,多增加了一道撒辣椒的程序。
DSH在“省token”这件事上,还留了一整套后手。它的PTC模式(程序化工具调用),让模型生成一段代码去组合多轮工具调用,原本要五次模型往返的操作序列,一次就完成了。
相当于是把五次的输入输出,压缩成了一次。
诚然,DeepSeek涨价了,还涨了不少钱。就算是梁文锋也没办法让DeepSeek永远便宜,但DSH能让“便宜”这件事在涨价之后依然成立。
模型定价是DeepSeek说了算,DSH能做的,是把每一分钱榨出最大价值,贵可以贵,但绝不白贵。
评论 (8)
安装门槛高会拦住不少用户,能不能弄简单点,降低点门槛就好了。
DeepSeek V4 Pro正式版发布还整出乌龙,这操作有点迷。不过Agent能力提升倒是挺不错。
价格涨这么多有点难接受,但DSH省token能弥补点,希望之后别再乱涨了。
这DSH思路挺新颖,一切皆插件的想法确实有创意,只是安装门槛太高,不太友好。价格方面,虽说便宜但涨价有点狠。
DSH测试效果还行,有些题能和Claude Fable 5打个平手甚至还能胜出,而且省token是真的厉害。
DSH和Claude Fable 5对比测试,各有胜负,DSH便宜这么多,性价比上占优。
DSH的理论挺厉害,时间和空间可组合性很有想法,就是不知道实际应用拓展得怎么样。
增量协调省算力的法子挺妙,就像做宫保鸡丁撒辣椒,实用又不浪费。