DeepSeek Harness开启内测?看来V4正式版也不远了

1 次阅读 2026年07月29日

从2026年3月崔添翼加入DeepSeek开始组建Harness团队到今天,憋了5个月,DeepSeek的Harness工具这回真的要来了?

一张截图在各大AI社区流传,内容是DeepSeek Harness的内部测试招募通知。

按照截图的说法,Harness计划于本周晚些时候开启内测,首批用户从小范围群组中筛选,入选者需要提交个人资料、签署《保密承诺函》,才能拿到产品访问权限。

并且截图显示,一旦泄密,不只是当次资格取消,还会影响日后DeepSeek各类模型、产品内测以及合作机会的入选。

虽然截图真伪无法验证,但结合DeepSeek此前关于V4正式版发布日期的公告,以及崔添翼曾表示Harness将和V4同时发布,那么这条传闻很有可能是真的。

然而目前市面上没有任何关于DeepSeek Harness产品形态的报道,按照DeepSeek以往的作风来看,Harness是重要产品,它的研发与设计一定是严格保密的。

不过我们还是能通过DeepSeek的各种蛛丝马迹,大致推断出这个产品大概长什么样。

DeepSeek Harness到底长什么样

DeepSeek Harness究竟长什么样?目前公开的信息只有两块,第一块是负责人崔添翼的量化背景,第二块是DeepSeek关于Harness部分的招聘职位描述(JD)。

先来说第一块,崔添翼不是做AI出身的。他在Jane Street做了九年的量化交易系统。

在量化交易系统里,最值钱的是执行系统。它讲究的是软件能不能在毫秒级别把策略变成交易?能不能在出了异常的时候自动恢复?能不能在每一步都留下可追溯的日志?

如果把这个思维搬到Harness上,那么其大体逻辑可能会是这样的:

量化交易里,慢一毫秒,钱就被别人赚走了。所以系统的每一步都得抠着毫秒级优化,不能有多余的步骤。

所以Agent循环的每一轮推理-执行-反馈都要快,不能有冗余开销。你跟AI说一句话,它不能半天没反应。从它想一下、到调用工具、到拿到结果、到再想下一步,整个循环必须得快。

同时,量化系统必须得非常可靠。如果量化系统崩了,那亏的是真金白银。所以哪怕行情再诡异、数据再离谱,系统本身不能挂,得能自己恢复。

模型可能会犯错,甚至输出一些离谱的东西给你,但Harness这个框架本身不能崩,得能兜住结果,想办法把模型拉回来继续干活。

其实在量化交易里,网络断了、交易所接口挂了、行情数据异常了,这些都是家常便饭。系统不能一遇到问题就死,得有重试、有备用方案、实在不行就降级,比如实时行情拿不到,就先用延迟数据顶着。

模型也是同理,调用工具失败了、文件读不出来、网络超时了,这些都是常事。好的Harness不会因为一个工具调用失败就整个任务废掉,它会自动重试、换个方法、实在不行就降级处理,继续推进任务。

另外,由于量化系统涉及大量的金钱,交易出问题了,得能查到是哪一步出错的,可能是下单的时候错了,也有可能是行情解析错了。每一步都得有日志,这样才能复盘。

Harness也一样,AI把活干砸了,你得能回看它是怎么一步步走到坑里的。是哪一步想错了?哪个工具调用返回了异常结果?它为什么做了那个错误的决定?

在整个量化系统里,订单状态也非常重要。不能出现“我以为下单了但其实没下”或者“重复下单”这种情况,每一步的状态都得是确定的、一致的。

放到Harness上,在所有人都押注长程任务、复杂任务的当下,能否维持模型中间的状态,将决定整个Harness的成功率。不能前面改了A文件,后面改B文件的时候把A的改动忘了。

最后是风控和安全了,量化交易有熔断机制,行情异常的时候自动停止交易,防止一个bug把钱亏光。另外,高风险的操作必须有审批,不能说下单就下单。

那么回到Harness里,在让AI删文件、格式化硬盘、跑sudo rm -rf这种高危操作之前,就必须得停下来进行确认。不能它自己想干啥就干啥,Harness得有个安全闸门。

从DeepSeek的JD里看产品

说完了第一块再说第二块,DeepSeek官方挂出来的岗位JD。

JD里提到了KV Cache、长上下文裁剪与压缩算法,说明Harness会做智能的上下文管理。

配合DeepSeek V4的前缀缓存能力,相同上下文的任务不重复计算。长对话中自动对历史消息做摘要,保留关键信息,释放token空间。根据任务复杂度动态调整上下文策略,简单任务用短上下文省成本,复杂任务拉满百万token的长上下文。

相当于是把每一份算力都花在刀刃上,小事能省则省,大事算力拉满。

JD里还提到了向量存储方案选型、会话状态持久化与回放,这也就意味着Harness有长期记忆系统,会记住你项目的架构、编码规范、常用模式,下次打开项目自动加载。

会话持久化代表就算你关掉终端后再打开,之前的对话状态、修改记录、执行轨迹依然都在。甚至DeepSeek Harness还可能记住你的命名风格、喜欢的框架版本,跨对话记忆你的各种习惯。

JD里提到了Tool Use链式调用、错误回退与自动重试,这是指Harness有完整的工具调用编排能力,能编排多步工具调用的有向无环图。工具调用失败自动重试,重试不行就降级换方案,再不行就回滚到上一个稳定状态。

划重点,DeepSeek Harness还可能支持动态注册新工具,Agent能自动发现并学会使用。

JD里提到了多Agent间通信协议设计、任务分解与结果聚合。这说明Harness有子Agent架构,一个主Agent负责任务规划和协调,多个子Agent负责具体执行。

不同子Agent有不同的系统提示词、工具权限、上下文窗口。主Agent把复杂任务拆成子任务,分发给子Agent,再把结果聚合成最终输出。每个子Agent运行在独立上下文或进程中,互不干扰,出错了不影响主流程。

JD里还提到了任务规划图生成、执行路径在线优化。这意味着Harness有规划与自进化的能力。

规划说的是接到任务后先生成执行计划,分几步、每步用什么工具、预期产出是什么。执行过程中根据实际情况动态调整,不是死板地按原计划走。每完成一步就自我检查,不对就自动修正。

而且,DeepSeek Harness很可能有一套内部benchmark,每次架构改动都跑一遍,看是进步了还是退步了,以此实现工具的自我进化。

最有意思的一点在JD最后,DeepSeek说,要让模型与Harness共同进化,实现模型与Harness的深度适配。

这也就代表了,Harness会利用DeepSeek-V4模型的特性,比如V4的稀疏注意力、前缀缓存。它不是通用Harness 框架,而是跟DeepSeek模型深度绑定的一体化产品。

其实这也是OpenAI现在的理念。

此前。OpenAI是有两条独立的后训练线。一条是代码专用的Codex线,一条是通用推理的GPT线。到GPT-5.5的时候,两条线合并了,GPT-5.5-Codex将代码能力和通用推理能力整合进了同一个模型。

这就好比汽车,原厂就像汽车厂家自己做发动机+变速箱,知道发动机的扭矩曲线、转速特性,变速箱换挡逻辑可以精准匹配。但是如果把这事交给第三方来做,发动机对他们来说是黑盒,只能凭感觉调变速箱,这就导致永远调不到原厂那么丝滑。

V4正式版,跳票一个月

Harness不是一个人来的。崔添翼曾表示,V4正式版和Harness将同步发布。

4月24日,DeepSeek发布V4 Preview,Pro和Flash两个版本同步开源。两个月后,在6月29日那天,DeepSeek向API用户发送邮件,明确说V4正式版计划于7月中旬上线。结果眼瞅着要到8月了,依然没有任何关于V4正式版的消息。

曾有传闻称,由于7月24日,DeepSeek旧的API deepseek-chat和deepseek-reasoner正式退役,所以V4正式版将会同期发布。毕竟更换API接口,通常是给新版本让路的前置动作。

可V4正式版依然没有发布。只是两个旧模型名正式停用,所有调用必须换成新的deepseek-v4-flash和deepseek-v4-pro。换句话说,API接口名换了,但模型本身还是预览版那套。

那么正式版比预览版强在哪?

综合多个内测信源的说法,称V4正式版在三个方向上做了升级:

核心推理能力再上一个台阶。

日常对话的响应速度明显优化。

Agent能力针对性迭代。

有参与灰度测试的人总结,V4正式版整体表现接近Opus 4.8级别,编码能力不弱于GPT-5.6 Sol,Agent能力和3D、SVG生成能力大幅提升。同样的任务比Claude Fable 5迭代轮数还少。

不过这些说法都来自非官方渠道,DeepSeek没有公开确认。

预览版的问题其实社区里讨论得不少。V4 Preview在编程能力上和Kimi K2.7、GLM 5.1接近,但仍然逊色当前的主流模型。

尤其是在那些复杂的任务上。有测试者发现,即便要求模型“不使用外部依赖”,模型依然引用了外部CDN。

遇到真正复杂的任务,需要手动加reasoning_effort=max(推理强度最高)才能拿到更深的思考深度,但变成agent往往会忽略这个提示词,导致模型思考的强度不够。

还有一点,虽然目前DeepSeek已上线识图模式(OCR),不过DeepSeek-V4的多模态能力也是短板。

按照DeepSeek官方的说法,预览版是纯文本,正式版首次原生支持图像推理,DeepThink引擎可以在同一个思考流程中分析图片、解读截图。这变相也增加了Harness工具的压力。

以及V4正式版会加入一些企业功能,但具体如何,DeepSeek官方并没有进一步透露。

再说价格,这是争议最大的部分。

V4正式版将引入峰谷定价机制,高峰时段(北京时间9:00-12:00和14:00-18:00)API价格直接翻倍。具体来看,V4 Pro缓存命中输入平时0.025元/百万 token,高峰0.05元;缓存未命中平时3元,高峰6元;输出平时6元,高峰12元。V4 Flash 缓存命中平时0.02元,高峰0.04元;缓存未命中平时1元,高峰2元;输出平时2元,高峰4元。

峰谷定价这件事,往好了说是把算力选择权还给用户,不急的任务挪到低谷时段跑,成本更低。可另一方面,在平时的办公时间,跑相同的任务,成本就会增加。

这不是DeepSeek第一次在定价上换思路。

2025年2月搞过夜间错峰优惠,V3五折、R1二五折。2025年9月 V3.1发布,取消夜间优惠,全天统一价,输出价格还往上抬了50%。

但关键问题不在于价格涨没涨,而在于结合Harness之后,整体使用成本会如何?

第三方测试显示,不同的harness 在完成同样任务时,token消耗差异巨大。测试机构用DeepSeek V4 Flash,分别测试了Claude Code、OpenCode和Pi这三个市面上最常见的Harness工具。发现,三种工具的代码质量基本一致,但Claude Code 每个任务平均跑约70次工具调用,OpenCode只有约22次。

此外,同一个任务,在弱Harness(Pi)里失败了,换到强Harness(Claude Code)里居然成功了。

因此,如何去平衡价格与性能,这是DeepSeek做Harness必须要面对的问题。

不过有一点我很放心,在省钱这件事上,梁文锋还是太权威了。

(10)

火乌鸦
火乌鸦 55分钟前

Harness按量化思路设计,可靠性和性能应该不错。等着看它和V4正式版一起出来啥样。

0
le衣Li
le衣Li 55分钟前

V4预览版有短板,像编程、多模态能力不足。正式版升级要是能解决就好了,就怕只是价格升得高。

0
声声叹
声声叹 58分钟前

Harness功能好多,上下文管理、工具调用编排啥的都有。希望出来后真能有这么强,别让大家失望。

0
大自然的小鸡。

V4预览版有问题,正式版升级得给力。峰谷定价影响成本,Harness得在性能和价格上做好平衡。

0
赏北海道蘑菇云

V4正式版跳票,还搞峰谷定价,DeepSeek想干啥。得看结合Harness后整体成本性能再决定用不用。

0

英伟达合作伙伴广达电脑寻求发行全球存托股票筹资不超22亿美元

人工智能服务器制造商广达电脑计划通过发行全球存托股票(GDS)筹资至多21.9亿美元。这家英伟达合作伙伴拟发行4900万份证券,每份发行价介于43.91美元至44.77美元。

澜起科技:首次回购50万股A股股份 支付金额约1.03亿元

澜起科技(688008.SH)公告称,2026年7月29日,公司通过集中竞价交易方式首次回购A股股份50万股,占总股本0.04%,回购金额约1.03亿元,价格区间为192.18元/股至210.00元/股。

北交所、全国股转公司启动全国重点专精特新企业培育专项行动

由北交所、全国股转公司联合江苏省委金融办、江苏省工信厅、江苏证监局主办,江苏股权交易中心协办的全国首场重点专精特新企业培训活动7月29日在南京举办。拉开了“全国重点专精特新企业培育专项行动”的序幕。本次活动坚持政策解读与实操指导“双轮驱动”理念,通过系统宣介工信、金融部门支持专精特新企业赴新三板、北交所挂牌上市的政策举措,深度解读区域性股权市场、新三板、北交所全链条服务专精特新企业成长的机制安排,深入剖析企业筹备挂牌上市过程中的常见问题并提供解决方案,旨在推动更多优质专精特新企业依托北交所、新三板市场实现高质量发展,完善覆盖专精特新企业成长全周期的梯度培育生态。参训企业表示,培训内容丰富务实,为企业科学规划挂牌上市路径提供了清晰可循的“导航图”。下一步,北交所、全国股转公司将发挥“工信部-交易所-地方金融部门-区域性股权市场”多方共育专精特新的服务机制,在全国范围内陆续开展专项行动系列活动,持续提升针对重点专精特新企业的管家式服务水平,为服务构建现代化产业体系和实体经济高质量发展积极贡献力量。

财通福鑫定开混合:将于7月30日开盘起至当日10:30停牌

财通基金管理有限公司公告,截至2026年7月29日上海证券交易所收盘,旗下财通多策略福鑫定期开放灵活配置混合型发起式证券投资基金(场内简称:财通福鑫定开混合,交易代码:501046)二级市场交易价格明显高于基金份额净值,出现较大幅度溢价。特此提示投资者关注二级市场交易价格溢价风险,投资者如果盲目投资,可能遭受重大损失。为维护投资者利益,本基金将于2026年7月30日开盘起至当日10:30停牌。

澜起科技:首次回购50万股A股股份,回购金额约1.03亿元

澜起科技公告,2026年7月29日,公司通过集中竞价交易方式首次回购A股股份50万股,已回购股份占公司总股本的比例为0.04%,购买的最高价为210.00元/股、最低价为192.18元/股,支付的金额总额约为人民币10276.49万元(不含佣金、过户费等交易费用)。

伊朗谴责美国沙特袭击伊拉克

据CCTV国际时讯,伊朗外交部今天(7月29日)发表声明,强烈谴责美国和沙特对伊拉克部分地区发动袭击。声明称,这些袭击侵犯伊拉克国家主权和领土完整,违反《联合国宪章》和国际法,目的是“服务于美国和以色列政权扩大西亚地区战争和冲突范围的图谋”。声明还称,袭击造成多名伊拉克民众死亡,伊朗对此表示哀悼,并重申对伊拉克政府和人民的支持。声明同时表示,美国及其地区盟友应对“这些罪恶、不人道和挑衅行为”所造成的后果承担责任。

知情人士:霍尔木兹海峡仍然完全封闭

7月29日,据伊朗媒体Fars News,一位军事知情人士表示,霍尔木兹海峡仍然完全封闭,任何船只都没有权利通过这一战略水道。任何试图通过的船只,特别是那些不理会警告的船只,将会面临果断和迅速的反应。

伊媒称美空袭伊朗与伊拉克边境地区

7月29日,据伊朗国家电视台,当地时间7月29日下午,伊朗西阿塞拜疆省皮兰沙赫尔市边境地带遭到美国空袭。

匈牙利议会投票决定取消该国关于加密货币交易验证的要求

7月29日,据The Block报道,匈牙利财政部长安德拉斯·卡尔曼(Andras Karman)表示,匈牙利议会投票决定取消该国关于加密货币交易验证的要求。这项废除措施属于一项更广泛税收方案的一部分,它取消了在进行特定加密货币兑换之前必须验证钱包所有权、资产来源及客户数据的义务。

卡布里贷款与OpenAI展开合作 将企业级AI应用于借贷业务运营

7月29日,卡布里环球资本有限公司旗下卡布里贷款与OpenAI展开合作,将企业级人工智能应用于借贷业务运营。