DeepSeek Harness,“杀死”Agent黑箱
摘要
撰文 | 郝 鑫 高晓阳 编辑 | 王 潘 近期,DeepSeek持续上演反转。 8月12日,没有发布会,没有预告,DeepSeek悄悄更新API文档,编号为“0813”的DeepSeek-V4-Pro正式版模型深夜静默上线。 高关注度和期待之...
撰文 | 郝 鑫 高晓阳
编辑 | 王 潘
近期,
8月12日,没有发布会,没有预告,
高关注度和期待之外,是现实体验与官方跑分之间的落差,还有一经上线便预告涨价的质疑。
8月13日,距离新模型发布不到24小时,
事后,有开发者发现
同天晚上,

模型是大脑,负责思考、推理和理解意图。但纯语言模型只能输出文本,无法直接操作文件、修改数据库和浏览网页。Harness是“身体”和“神经系统”,它提供了模型与外部世界交互所需的一切,包括工具调用、文件读写、沙箱环境、权限管理、任务编排等。
没有Harness,模型只是一台会说话的引擎,但无法成为真正干活儿的Agent。
从我们的测试结果来看,也的确如此。在
祛魅和争夺范式
“一切皆插件”是
这个理念由北大与
一是时间可组合性通过“可逆效应”机制,让系统自动记录并撤销组件卸载后的副作用,加载过程即决定卸载过程,确保系统长期稳定。二是空间可组合性通过“响应式共效应”实现声明式依赖管理,组件只需声明需求,运行时就能自动协调依赖变化,实现动态激活与停用。
两者融合于统一的上下文、承载状态、生命周期边界和依赖环境。Harness因此可实现“无特权核心”,所有组件包括Agent主循环均可替换,开发者通过配置文件即可自由组合。这一理念为构建灵活且面向未来的Agent基础设施奠定了方向。
在OpenAI、Anthropic等巨头纷纷定义自己的Harness时,

OpenAI和Anthropic的战略是“向下整合”,即通过打造体验极致、深度绑定自家模型的Harness,巩固其在AI应用层的优势;
网传的
在此之前,OpenAI和Anthropic的Harness更像一个“黑箱”,其内部优化是核心机密,如何打造Agent产品被视为一种“特权”。
当Harness被充分祛魅,成为一个透明、可被随时替换的组件后,整个价值链上,唯一不可被标准化、仍会持续进化的,就只剩下最底层的“模型”本身了。
如果把
Harness和开源就像是免费修建的高速公路,前期用来吸引车流,而当车流足够多时,顺势提高燃油的价格,便成为了最高效的商业兑现方式。
砍掉prompt,场景一次跑通
昨天的文章里,我们测评了
恰好
安装的过程就不赘述了,推荐大家用npm(Node.js的默认包管理器,安装并管理项目所需的各种第三方库,可以简单理解为一个开放的应用市场)安装,也方便升级和安装其他插件,可以直接运行npx @deepseek-ai/dsh web启动,如果卡住不动的话,可以先运行一遍npm install -g @deepseek-ai/dsh,然后再运行刚才的命令就可以顺利启动了。

初次打开和大部分Agent一样,只不过在

装好环境之后正式开始今天的测试,《指环王》这个基准测的不是“会不会画一只鹈鹕”,而是“读懂一段文学→理解一个世界→把世界程序化搭出来”的完整链路,是目前圈内最狠的Agent考题之一。
昨天的测试为什么不算数?因为我们当时只给了3句开头,而Karpathy给Opus 5的是原著第一段。今天我们把原文补齐:第一章前段完整文字,从比尔博宣布111岁生日宴会,到霍比屯议论,再到弗罗多身世往事,共计1817个词、23段,一字不改。
第一次测试,我们按“评测就该严谨”的思路,把提示词写得滴水不漏,1817个词的原文,加上场景要素清单(洞屋要有圆形门、宴会长桌要有食物、宾客要议论纷纷),再加上运镜要求、灯光要求、比例要求,一共五条硬性要求。
结果很打脸,第一次生成的效果非常粗糙,叙事也不完整。场景是搭出来了,但离“霍比屯的生日派对”相距很远。效果呈现上,运镜支离破碎,画面像是赶工出来的半成品。穿模很严重,山坡上站的小人像是插了一堆棒棒糖。我们复盘了一圈,把原因归结为提示词太长了,列出的场景限制了模型的发挥。
第二次,我们把提示词砍到只剩目标,读懂原文,用Three.js搭出霍比屯生日派对的3D世界,运镜按原文节奏走,保存为完整可运行的HTML文件。场景要素、灯光、比例要求,全部删掉。
效果反转了。
场景竟然一次就跑通,洞屋、比尔博、弗罗多、宴会长桌、酒馆前议论的霍比特人,该有的都有;角色只有轻微漂浮和穿模,属于“能看出是霍比屯”的范畴;运镜叙事成立,按原文节奏从俯瞰霍比屯推到比尔博,再扫过议论的人群,最后环绕宴会长桌。
同一个模型,同样的原文,一个细致入微的提示词换来翻车,一句直白的目标换来及格以上的结果。看来现在顶级的模型反而不需要详尽的提示词,只需要用直白简洁的话告诉他目标就可以了,说多了反而效果会变差。
这不是孤例,GPT-5.6 Sol刚发布时,社区就有人反馈,套上精心优化的提示词和流程skill,反而会让模型陷入死循环。
这个发现值得单独提出来,提示词的作用正在从“写剧本”变成“定目标”,给顶级模型写小作文的时代可能真的过去了。
DeepSeek Harness到底行不行?
回到今天的正题,
响应更快了。同样的测试,
缓存命中率涨了一个点。前一天在Claude Code接入是98%,在

再看测试本身,第一次的长提示词翻车,发生在
作为一个刚发布的开发者预览版,这是很加分的稳定性,而且

短期内,
但从长期来看,

Harness作为完全开源的Agent框架,定义了“模型如何被调用、工具如何被组合、任务如何被编排”的底层标准,吸引了海量开发者和真实任务涌入。而这些真实任务的执行轨迹,通过Harness内置的可观测体系,源源不断地回流,为
反过来,
当这套飞轮转起来,开发者的选择就变得不再困难。因为使用
这正是
本文来自微信公众号 “guangzi0088”(ID:TMTweb),作者:郝鑫 高晓阳,36氪经授权发布。
评论 (10)
这DeepSeek事儿挺乱,新模型上线就出问题,不过Harness理念挺新,开源说不定能成气候。
模型、开源、Harness、涨价一套组合拳,DeepSeek目标明确,就看商业变现顺不顺。
DeepSeek这反转剧情挺多,Harness要是能和模型配合好,未来可期。
DeepSeek战略和别家不一样,‘横向铺开’搞开源,感觉有野心,就看能不能成了。
DeepSeek的思路挺独特,开源祛魅黑箱,要是真成了,AI格局得变。
测试提示词这事儿挺意外,现在模型简单说目标就行,写详细了还翻车。
DeepSeek Harness响应和缓存有提升,稳定性也不错,长期看和模型能形成好闭环。
这测试结果有意思,提示词从‘写剧本’变‘定目标’,模型发展有点快。
DeepSeek Harness刚发布,现在普通用户用着不太行,长期看潜力不小。
新模型上线就出状况,还好Harness有点亮点,不然这波操作就太拉垮了。