风险提示:理性看待区块链,提高风险意识!
币界网
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

模型可替换、工具可插拔:DeepSeek把Agent竞争从“大脑”推向“操作系统”

摘要

币行吧报道: DeepSeek在8月14日开源了Agent框架DeepSeek Harness。它没有把自己做成一个只能连接...

模型可替换、工具可插拔:DeepSeek把Agent竞争从“大脑”推向“操作系统”
币行吧报道:

DeepSeek在8月14日开源了Agent框架DeepSeek Harness。它没有把自己做成一个只能连接DeepSeek模型的封闭产品,而是把模型、工具、存储、沙箱等组件都设计成插件,并以MIT许可证发布。开发者可以接入其他公司的模型,也可以替换执行环境和记忆系统。对一家因基础模型成名的公司来说,这个选择很有意味:DeepSeek正在把竞争位置从“提供最聪明的大脑”,向“控制智能体如何完成工作”推进。

Harness目前仍是开发者预览版。官方明确提醒,后续会出现破坏兼容性的变化。它已经可以打开代码仓库、编辑文件、运行命令、搜索网页、制订可执行计划,把部分任务交给其他Agent,并保存工具调用、运行结果和模型交互记录。旧会话可以继续,也可以从较早节点分叉。这些功能听起来不如一个新模型参数量醒目,却直接决定Agent能否从演示走进生产环境。

与Harness一同受到关注的还有DeepSeek V4-Pro-0813。DeepSeek公布的数据显示,模型在Terminal Bench 2.1上得到87.9分,在Toolathlon-Verified上为74.1分,在DSBench-FullStack和DSBench-Hard上分别为71.1分和67.2分。部分公开编码Agent测试使用了Harness的最小模式。但这些数字属于厂商自报结果,不能直接等同于所有企业场景,更不能证明预览版框架已经具备生产稳定性。

Agent真正难的部分,正在从回答问题变成管理过程

单次问答只需要生成一个看起来合理的结果,Agent却要在几十甚至上百个步骤中保持方向。它必须记住已经做过什么,知道什么时候调用工具,判断结果是否可信,在权限边界内修改文件,并在走错路时留下可回退的节点。模型能力决定上限,执行框架决定这套能力是否能被安全、重复地使用。

这也是“所有东西都是插件”最实际的价值。企业不会只用一个模型:高难任务可能交给强推理模型,批量分类交给便宜模型,敏感数据则需要本地模型。若工作流与某一模型深度绑定,每次价格或能力变化都会牵动整套系统。Harness把模型降为可替换组件,理论上可以让企业根据任务成本、合规要求和延迟动态选择供应商。

插件化也把原本隐藏的工程问题暴露出来。沙箱如何隔离危险命令,工具凭证如何分发,长期记忆保存多久,失败任务怎样恢复,审计人员能否复现Agent的决定,这些都比“让模型再聪明一点”更接近企业真正付费的地方。Harness保存会话步骤并支持分叉,说明DeepSeek理解Agent需要的不只是答案,还需要可观察、可追踪和可修复的运行历史。

但开放架构并不会自动带来安全。插件数量增加,也意味着供应链攻击、权限滥用和版本冲突的入口增多。MIT许可证给了商业使用很大自由,却不会替使用者承担验证责任。尤其在框架明确处于预览期时,把它直接连接生产数据库或自动发布系统,风险远高于在隔离环境里评测。

开源Agent框架争夺的,是开发者默认入口

基础模型正在快速商品化。不同模型之间仍有能力差异,但API价格持续下降,版本迭代越来越快,企业也在主动避免单一供应商锁定。谁能成为模型外面的那一层,谁就可能掌握工具标准、插件生态、运行日志和开发者习惯。这个位置更像AI时代的应用运行环境,而不只是一个聊天界面。

DeepSeek允许竞争对手模型进入Harness,看似削弱了自家模型的独占性,实际上可能扩大其生态影响。如果开发者先用Harness搭好任务、权限和插件,未来即使更换模型,工作流仍留在DeepSeek定义的框架里。模型调用收入不是唯一目标,成为Agent开发的默认底座同样有长期价值。

当然,Harness还远没有赢下这场竞争。开发者预览意味着接口会变,生态尚未成熟,企业需要重新验证稳定性、权限和维护成本。官方基准也需要独立测试,特别是长任务成功率、错误恢复、Token消耗以及真人接管的频率。一个Agent在十分钟演示中完成任务,不代表它能连续运行一个月而不积累隐患。

这次开源最重要的信号,不是DeepSeek又多了一个产品,而是AI公司的边界继续外扩。模型公司开始争夺Agent运行层,云厂商争夺工具和数据入口,开发平台争夺插件规范。下一阶段的胜负不会只由谁在榜单上高几分决定,还要看谁能让不同模型在真实系统里稳定做事,并让每一步都能被看见、约束和撤回。Harness给出的答案很开放,但它能否成为标准,仍要由生产环境而不是发布当天的热度来证明。

评论 (5)

登录 后即可发表评论
游船侠客
游船侠客 1小时前

AI公司边界外扩,竞争越来越激烈了,就看谁能让模型在真实系统稳定运行。

0 回复
配齐
配齐 1小时前

DeepSeek这是想扩大生态影响,让工作流留在自己框架里,算盘打得挺精。

0 回复
左都御使
左都御使 1小时前

这思路不错,把组件插件化,企业选择多了。不过预览版风险大,得等稳定了再用。

0 回复
静定
静定 1小时前

开放架构安全是个大问题,插件多了漏洞也多,得小心供应链攻击。

0 回复
孤勇者(面对困境不屈,平凡人也能成英雄)

Harness还早着呢,接口会变,生态不成熟,企业得好好验证成本。

0 回复
更多