Anthropic试图彻底杀死Harness Engineering
摘要
Anthropic今天发了一个新的产品。 定位是: 你不用做Harness了,我帮你做。模型的局限性我最清楚,我来按模型特性设计 Harness,打包卖给你。而这个包,就是 Managed Agents。...
Anthropic今天发了一个新的产品。
定位是: 你不用做Harness了,我帮你做。模型的局限性我最清楚,我来按模型特性设计 Harness,打包卖给你。而这个包,就是 Managed Agents。
这一幕,很像十年前,AWS 先教育市场什么是云计算。等所有人都认为“上云”是必要的,AWS 说:你自己搭不好,我来。大多数企业最终选了托管。因为基础设施从来不是核心竞争力。
Anthropic 做的事情一模一样。
先发三篇博客,一步步教会整个行业什么是 harness、为什么 harness 比模型重要、怎么设计好的 harness。(Anthropic说:不要在等下一代模型了,立刻马上做Harness!Anthropic说:网传的Harness思路过时了,做这3件事就够!Anthropic 产品负责人:PRD 已死,原型万岁)
还是以 context anxiety 为例,抛出了新的产品。
Sonnet 4.5 快到上下文窗口极限时会“焦虑”,提前收工,质量急剧下降。所以他们早期在 harness 里加了 sprint + context reset 来应对。
后来Opus 4.5 出来后,焦虑消失了。Sprint 直接被砍了。之前的补丁变成了累赘。
所以,之前的结论是:Harness 的可能性空间不会缩小,只是在移动。每一代模型出来,都得重新审视哪些约束还管用。
但现在换一个角度看这个例子: 如果你自己搭了那套 sprint + context reset,你浪费了工程时间。如果 Anthropic 帮你管 Harness,他们升级模型的同时就把 Harness 也更新了。你什么都不用动。
这就是 Managed Agents 的主要卖点: harness 的保鲜期太短了,短到你自己维护不划算。
技术上是怎么做到的?
之前的 Claude Agent SDK,相当于是把 推理循环、代码执行、会话记录... 全塞在一个容器里。容器挂了,会话丢了。
现在他们把它拆成了三块:
-
大脑:Claude 和它的 harness,负责思考和决策
-
手:沙盒和工具,负责执行
-
记忆:独立的会话日志,记录一切
这三者之间互不依赖。容器挂了?新容器可以重建。 Harness挂了,新的 harness 拿到会话日志,从断点继续。没有什么东西是不可替换的。
当然最核心的一点是: Harness 变成了一个可替换的 热插拔 模块。而掌握热插拔权的,是 Anthropic,不是你。
马东锡大佬,有个很好的总结:
Harness 不关心沙盒到底是一个容器、一部手机、还是一个宝可梦模拟器。只要符合“名字和输入进去,字符串出来”的接口就行。
写在最后
之前,大家都在说: Harness意味着,真正稀缺的能力不在模型里面,在模型外面。
但是今天Anthropic在尝试把“模型外面”这层东西,重新装回“模型厂商里面”。
Harness Engineering 不会死。但“人做 harness”这件事的窗口期,可能比所有人预想的都短。
你的 Harness 要么被模型进步淘汰,要么被平台服务替代,要么你得跑得比这两者都快。
不过,从现实的情况来看,通用 Harness 能覆盖大部分场景,但覆盖不了所有场景。法律、金融、医疗,每个领域的 Agent 都有自己的评估标准和安全边界。通用平台做到 80 分不难,最后 20 分才是竞争力。
更何况开源社区还会走出很多更有意思的路线,比如昨天分享的Hermes。
让Agent 自己写 Skill,Agent 用 Skill,Agent 改 Skill。不把 Harness 交给平台,让 Agent 自己写自己的 Harness。
评论 (0)
暂无评论