风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

2026年Q2 AI Agent演进实录:从工具到操作系统,再到人的新位置

摘要

Agent不再只是助手,它正在成为新操作系统 去年底,AI还被当作一个聪明的问答框——问一句,答一句,对话结束,任务归零。但进入2026年第二季度,局面已彻底改写。OpenClaw、Codex与Claude Cowork等系统陆续落地,AI...

2026年Q2 AI Agent演进实录:从工具到操作系统,再到人的新位置

Agent不再只是助手,它正在成为新操作系统

去年底,AI还被当作一个聪明的问答框——问一句,答一句,对话结束,任务归零。但进入2026年第二季度,局面已彻底改写。OpenClaw、Codex与Claude Cowork等系统陆续落地,AI不再等待指令,而是主动读文件、跑代码、填表格、调API,甚至直连企业ERP与CRM。你只需给它一个目标,它便自行拆解、调度工具、执行验证、反馈结果。这不再是“辅助”,而是“接管”。 OpenClaw诞生于3月,它像一道分水岭:此前谈Agent,语境是程序员的副手;此后谈Agent,语境已是金融分析师、法务专员、UI设计师的日常搭档。短短三个月,它已嵌入真实工作流,在券商合规、律所尽调、设计工作室原型生成等场景中稳定输出。企业迅速跟进,掀起一场名为Tokenmaxxing的激进实验——无上限分配算力、延长运行时长、开放全部工具权限。然而两个月后,这场运动戛然而止。不是因为技术不行,而是因为人没跟上:审核卡点、判断缺位、责任模糊,让自动化产出在最后一公里集体滞留。 于是,二季度的核心命题悄然转移:问题不再是“Agent能不能干”,而是“人如何与Agent共构高效闭环”,以及“怎么让Agent干得更省、更稳、更可持续”。

通用Agent:入口之争尘埃落定

Codex、Claude Code(Cowork)、Workbuddy等系统,在Q2完成了关键跃迁——从编程专用走向通用执行体。OpenAI内部数据显示,4–5月间,使用Codex的非编程用户增长达20%,增速是开发者用户的三倍。原因很朴素:只要流程可重复,就值得交给Agent。而Harness运行框架与Skill技能模块的成熟,让Agent真正具备了跨域执行能力——它不一定全都会,但已能稳稳拿下大量标准化、结构化、链路明确的任务。 这也终结了持续一年的“AI入口”之争。2025年,行业曾笃信AI浏览器是终极入口:Google推Mariner,OpenAI做Operator,Perplexity上线Comet,甚至传出天价收购Chrome的传闻。逻辑很清晰——既然网页承载了人类数字生活二十年,那AI也该从浏览器出发,模拟点击、填写表单、解析DOM。 但现实给出了相反答案。2026年5月,Google关闭Mariner,能力并入Gemini Agent;Operator融入ChatGPT Agent生态。与此同时,Codex与Claude Code直接接入本地文件系统、终端、Git仓库、数据库连接器与桌面应用,调用效率远超网页爬取。根本原因在于:GUI为人而设,颜色、按钮、动效都是认知辅助;Agent不需要理解界面,它要的是结构化输入与确定性接口。CLI与API才是它的母语。 因此,浏览器并未消失,而是降级为Agent工具箱中的一个组件——只负责呈现结果、供人确认、支持圈选修改。数据在底层流动,页面只做“人机交接站”。入口已稳,战场转向纵深:谁能把通用Agent,快速适配进专业领域?

垂直落地:知识即插件,行业即配置

Anthropic在4月推出Claude Design,让Agent读取品牌规范、设计系统与前端代码库,自动生成高保真稿、交互原型与营销PPT;随后上线按岗位建模的金融Agent,覆盖估值审核、总账核对、月结流程与KYC尽调,并将同一套方法论平移至法律领域。 OpenAI则选择另一条路径:不另起炉灶做垂直模型,而是通过Apps、MCP(Model Control Protocol)、AgentKit与Frontier,将金融、健康、科研、安全等能力注入底层模型,并打通企业现有系统。形式不同,逻辑一致——通用Agent是底盘,行业知识是可插拔模块。 过去,大模型进军一个行业,意味着定制数据、重训模型、开发新接口、重构流程。现在,只需替换Skill包:金融场景装上估值逻辑、合规规则与财务数据库;法律场景换上条款库、判例索引与合同审查checklist。运行环境、调度框架、记忆机制全部复用。垂直软件的护城河,正从“私有模型+封闭架构”,转向“行业知识沉淀+组织反馈闭环”。 谁能更快积累真实业务反馈——比如某份法律意见是否被客户采纳、某个估值假设是否被投委会否决——谁就在Agent进化中握有不可复制的先手。数据不是静态资产,而是动态训练信号。只要市场尚未固化,这种反馈驱动的迭代优势就将持续存在。

Tokenmaxxing:一场昂贵的认知错觉

5月,“Tokenmaxxing”成为最热词。逻辑看似合理:给员工更多Token、更长运行时间、更全工具权限,产出理应翻倍。黄仁勋公开表示:“年薪50万美元的工程师,若一年未消耗25万美元Token,老板该警惕他是否真正拥抱AI。” 热潮很快退去。亚马逊内部排行榜催生大量刷量任务,被迫关停;Uber的Claude Code预算四月告罄,却未见有效功能增长。根本症结有二: 一是成本失控。普通问答仅需一次推理,Agent执行长任务则反复读状态、查历史、验结果、试错误。复杂任务Token消耗可达普通问答的数十乃至千倍。哈工大提出“有效反馈算力”指标,发现复杂任务中仅约10%的Token真正推动决策,其余90%消耗于重读、试错与无效往返。 二是组织断点。代码写完要审核,报告生成要溯源,设计稿要过品牌关。MIT研究显示:自主编程Agent使GitHub提交量增120%,但立项通过率降至50%,最终上线率仅30%。效率提升卡在人工复核环节——这正是经济学中的“替代理论”:系统整体效率,由最慢的不可替代环节决定。 更隐蔽的问题是重复建设。南洋理工分析两万个Skill模块,发现75%高度雷同,去重后仅剩五千余个。代码修复常因“他人已解决”被拒。AI加速了供给,却未同步扩大需求:App数量激增40%,下载量纹丝不动。Token烧不出本不存在的市场。 Tokenmaxxing失败的价值,在于精准暴露两大瓶颈:技术侧——Agent运行低效、成本难控;组织侧——复核机制缺位、责任链条断裂。下一阶段的突破,正围绕这两点展开。

Multi-Agent与自进化:把人从Loop里请出来

既然单Agent跑不快、审不准,那就派一群。2026年Q2,Multi-Agent成为主流范式,核心是“编排者—执行者”结构:主Agent拆解任务,分发至多个子Agent并行处理,再汇总结果。Claude Research用此模式分头检索、交叉验证;Kimi Agent Swarm支持数百子Agent协同处理视频、代码与搜索,部分任务延迟降低4.5倍。 但当前Multi-Agent本质仍是“项目经理+外包团队”,而非真正协作。Anthropic测试表明:一旦撤掉中心编排者,让Agent自主协商,准确率反低于单体Agent——模型从未被训练过“合作”,它们擅长单打独斗,不理解“我的行动影响你的处境”这类博弈逻辑。 真正的协作需要制度设计:任务如何划分?信息如何共享?错误归责?奖励如何沿链回溯?长期表现差的Agent是否淘汰?这些不是工程问题,而是组织协议问题。 另一条更激进的路径是“自进化AI”(RSI)。Anthropic让模型持续优化一段用于训练小模型的代码,从Claude 3到Mythos,加速比从3倍升至50倍。其本质是将人类科研五步法(发现问题→构思方案→搭建环境→验证结果→保留有效改动)完全自动化。只要目标与评分标准足够清晰——例如“将代码运行速度提升50倍”——Agent就能闭环迭代。 但它仍缺乏“品味”:在方向模糊、空间巨大、需权衡多重价值的决策中(如“哪条技术路线更有长期价值”),Agent表现远逊人类。Anthropic实验显示,在人类已犯错的复杂判断场景下,模型仅20%概率优于人;若人类本身判断准确,模型几乎无胜算。 与此同步兴起的“Loop Engineering”,则让Agent脱离被动触发,转为长期自主运行:自动发现任务、执行、验证、记录反馈、规划下一轮动作。这不是功能升级,而是工作范式的迁移。

经济账:CPU回归中心,模型开始分层

Agent改变的不仅是软件架构,更是硬件经济。过去GPU是绝对主角,因其擅长密集矩阵计算;但Agent工作流以推理—调工具—等响应—再推理为主,大量时间耗费在模型外环节:启动浏览器、管理文件、处理超时。《A CPU-Centric Perspective on Agentic AI》指出:工具调用占任务延迟最高达90.6%,CPU动态能耗占比达44%。联合优化CPU/GPU调度后,部分负载中位延迟改善超2倍。 资本市场迅速反应:AMD 2026年Q1服务器CPU收入同比增长50%以上,公司上调2030年CPU市场规模预测至1200亿美元,核心依据正是Agent带来的调度、数据移动与并发执行需求。 模型价格也正式分层。2026年Q2,主流低价模型百万Token成本已降至几美分,前沿模型则高达数十美元,价差从两年前的30倍拉大至600倍。低价模型承担日志解析、代码分类、信息抽取等基础任务;高价值判断——如安全审计、法律解释、失败复盘——才值得调用最强模型。 Sakana推出的Fugu路由系统,标志着这一趋势的工程落地:它不依赖模型自身判断任务难度,而是训练专属Agent做智能分派——先理解任务,再动态组建“模型团队”,贵模型只处理关键节点。实测显示,花一半成本即可达到最优模型效果。编程领域最先跑通:低价模型读代码、写测试,中档模型做常规修改,强模型专攻核心重构与安全复核,最后交由CI/CD工具验收。未来,Codex与Claude Code类产品,将越来越像一支受预算约束、按能力分工的模型工程队。

正在收缩的现实:工作、安全与人的思考

Agent的影响,已从技术层穿透至社会肌理。最先变化的是岗位结构:客服、工单、基础运营、初级数据分析与运维岗位,正被系统性吸收。更隐蔽的是“预算挤出效应”——GPU、数据中心与模型团队开支暴涨,迫使企业削减其他部门预算。部分岗位名称未变,职责已彻底重构:员工从执行者,转向Agent管理者、流程设计者与复杂决策者。 初级岗位首当其冲。查资料、写总结、码基础代码、整理客户信息——这些曾是新人理解业务、熟悉代码库、学习组织判断标准的“认知学徒期”,如今全被Agent接管。宾夕法尼亚大学沃顿商学院实验显示:允许使用AI后,超半数参与者主动求助;即使AI给出错误答案,仍有80%选择相信。Anthropic研究亦证实:AI辅助组完成陌生任务更快,但闭卷测验成绩平均低17%。任务交出去了,能力没留下来。 安全边界也在收窄。Anthropic的Mythos展现出强大漏洞挖掘能力,公司不敢开放;OpenAI前沿模型采取有限访问策略。模型能力越强,可控性越难保障。谁能用、谁可信、谁受监管,已不单是技术问题,更是地缘政治议题。 信息生态同样异化。Graphite分析指出:AI生成内容占全网比例稳定在48%-50%,但ChatGPT引用来源中AI生成内容占比半年内从38.9%升至42.7%。机器引用机器,形成闭环回音室。真实采访、现场核查、署名负责的内容反而稀缺。 最深层的危机是“认知缴械”:问题刚浮现,手已伸向ChatGPT;观点未成形,提纲已被列好。犹豫、试错、怀疑、查证被顺滑答案折叠,人跳过了判断形成的全过程。泰勒制把工人变成手,AI可能把人变成认知流水线上的盖章点。 因此,未来的AI设计,或许需要主动保留摩擦:高风险操作前强制解释,结论呈现前先书写个人判断,主动展示反方证据。慢一点没关系,关键是为思考与学习留下位置。

尾声:八个趋势,一条主线

2026年Q2的八个趋势,实为同一演进逻辑的八面切片:通用Agent确立操作系统地位;前沿模型借其切入垂直领域;Tokenmaxxing撞墙揭示人机协同断点;Multi-Agent与自进化AI尝试补位复核与迭代;CPU重掌调度权、模型开始分层定价;就业结构、安全边界、信息生态与个体认知随之重塑。 企业接下来要积累的,不该是Token消耗量,而应是每一次执行沉淀下的可复用工作流、评测标准、权限体系、组织记忆与反馈闭环。否则预算耗尽,只剩一张账单。 对个体而言,无需与AI比生成速度。机器擅长交答案,人真正的不可替代性,在于判断题目值不值得做、答案会引发什么后果、并为最终结果担责——这才是人在AI时代的新坐标。

评论 (8)

登录 后即可发表评论
冷静的热心市民

AI把初级岗位都占了,新人怎么积累能力啊,这是个大问题

0 回复
过去的一定后悔

硬件经济都被AI改变了,CPU又重要起来。模型价格分层这事儿确实实际

0 回复
啊泉
啊泉 2周前

Tokenmaxxing这玩法就是瞎搞,成本高还没效果,资源都浪费了

0 回复
老三醉初酒水批发

人不能被AI完全代替,得保留自己的思考和判断能力,这是根本

0 回复
伊甸点
伊甸点 2周前

Multi - Agent和自进化AI看着有戏,不过得解决好协作和判断的问题才行

0 回复
更多