具身智能的“ChatGPT时刻”,可能不会同一天到来

0 次阅读 2026年07月20日

在WAIC 2026智启具身论坛,行业在探讨的,是一套能够在物理世界持续学习、自我改进的系统。

听完后,一个很明显的感受是:虽然“人形机器人”依然是最容易吸引镜头的概念,但台上被反复讨论的关键词,已经从自由度、关节数量和动作展示,转向了数据、模型、仿真、部署、失败反馈和持续学习。

这意味着,具身智能正在进入一个新阶段。

过去两年,行业首先要证明机器人“能做”;现在,问题变成了它能不能连续做几百次、几千次,换一个环境还能不能做,失败以后能不能自己恢复,以及部署出去以后,能力能否继续增长。

换句话说,具身智能的竞争,正在从机器人产品竞争,变成一场训练系统和数据基础设施的竞争。

01、物理AI的Scaling Law,卡在交互经验

大语言模型的Scaling Law相对直接:更多数据、更大模型、更多算力,通常可以换来更好的能力。

但物理世界并不是一个可以直接爬取的互联网。

智元合伙人、觅蜂科技董事长兼CEO姚卯青在演讲中将物理AI面临的问题概括为“三道墙”:数据墙、表征墙和闭环墙。

数据墙,是高质量真实交互数据昂贵且稀缺;表征墙,是不同任务、场景和机器人本体之间,尚未形成足够统一的物理表征;闭环墙,则是真实世界中的试错速度慢、成本高,一次失败可能带来零部件损坏,甚至影响整台机器。

这个判断很重要。

语言模型犯错,通常只是生成了一个错误答案;机器人犯错,可能打碎杯子、碰伤人或者造成产线停机。因此,物理AI真正需要规模化的,并不只是“数据量”,更是可执行、可评价、可回流的交互闭环

这也解释了为什么把一个大模型接到机器人上,并不等于完成了具身智能。大模型擅长回答“这是什么”“应该做什么”,机器人还必须解决“怎样做”“力度多大”“失败后怎么办”,以及“做完以后,世界发生了什么变化”。

从数字AI到物理AI,是要把经验规模化。

02、数据开始从“数量竞赛”变成“配方竞争”

本次论坛最值得关注的变化,是几乎所有团队都不再相信单一数据来源能够解决问题。

目前逐渐形成的数据结构,大致像一个金字塔。

底层是规模最大的互联网视频和人类行为视频,它们成本低、覆盖广,可以帮助模型理解物体、场景和人类行为;中间层是第一视角、UMI等“无本体数据”,即通过手持或穿戴式设备记录人的动作轨迹,绕开昂贵机器人的采集瓶颈;顶层则是真机遥操作数据、实际部署数据以及机器人失败后的回流数据,数量最少,却最接近真实执行。

姚卯青在圆桌中估计,若将机器人的“ChatGPT时刻”定义为能够开箱即用、理解开放式自然语言指令,并在常见任务中达到70%至80%的基础成功率,具身数据可能需要达到亿小时级别。这个数字,说明了真机采集不可能是唯一答案。

清华大学计算机系副研究员苏航把具身预训练的演进归纳为三条线:数据从单一本体走向多源混合,模型从行为模仿走向世界建模,学习从离线训练走向真实部署中的持续进化。

这意味着,未来的模型不会只学习“看到这个画面就做这个动作”。它还要理解任务进展、预测动作后果,并把不同机械臂、人形机器人和场景中的经验压缩成可迁移的能力。

数据基础设施由此成为具身智能产业链里越来越重要的一层。觅蜂科技展示了MEgo系列采集终端、MEgo Engine治理平台和AGIBOT WORLD真机数据集,试图把采集、清洗、标注、评测和部署回流接成一条链。商业价值可能也会从“出售一批数据”,转向帮助客户设计数据配方,并证明这批数据确实提升了模型表现。

对具身智能来说,低质量数据的规模化甚至可能放大问题。一个动作标签偏差、一段时间没有对齐的传感器数据,进入训练后都会变成机器人执行时的误差。数据量很重要,数据能否跨本体复用、能否回到真机闭环验证,重要性更高。

03、VLA和世界模型,正在从路线之争走向融合

过去一段时间,具身智能存在一场路线争论:机器人应该直接使用视觉—语言—动作模型,也就是VLA,从图像和指令端到端输出动作;还是应该先建立世界模型,预测每个动作可能给环境带来的变化,再决定如何行动?

从这次论坛释放的信息看,两条路线正在走向融合。

智元展示的GO-2强调动作思维链,让机器人先做粗粒度规划,再完成高频、精细的执行;Act2Goal则通过预测中间视觉状态,实现“先想后做”。智元将VLA与世界动作模型融合后的方向称为WRAM,即世界推理动作模型。

Physical Intelligence研究科学家任至意展示的π0.7模型,则提供了另一个有代表性的结果:模型在ARX机械臂上学习衣物折叠后,可以迁移到UR5双臂机器人上执行相似任务,不需要针对新本体重新微调。

跨本体迁移,是具身智能能否形成平台型公司的关键。

假如每换一种机械臂、夹爪或者机器人,都要重新采集数据、重新训练模型,那么机器人行业最终仍然会停留在传统自动化项目制。一旦模型能够把不同本体的经验映射到相对统一的动作空间,软件和数据才可能获得真正的规模效应。

清华大学苏航提出的方向同样指向统一表征:数据从单一本体走向多源混合,模型从行为模仿走向世界建模,训练则从一次性离线学习,走向部署过程中的持续进化。

最终的物理AI系统,可能是一个多时间尺度系统:上层理解语言和任务,中层预测未来状态并制定计划,底层负责高频控制和即时反应。

这更像人类的大脑、小脑和神经反射系统协同工作,而不是让一个模型以同样频率思考所有问题。

04、真正的分水岭,是从“视频能看”到“机器能用”

具身智能行业曾经有大量令人惊艳的演示,但演示和产品之间存在一条很深的鸿沟。

一个机器人成功叠好一次衣服,可以制作一段传播广泛的视频;一家工厂真正关心的,却是它能否连续工作,成功率是否稳定,出现异常是否能够恢复,维护成本能否被节省的人力覆盖。

这次论坛上,一些数据开始具有产业参考意义。

据智元现场披露,其机器人在江西南昌的一条3C产线上进行了连续六天、每天超过10小时的作业,累计完成接近6.5万次操作,成功率达到99.99%。

Dyna Robotics披露,其商用基座模型DYNA-1在餐巾折叠任务中成功率达到99.4%,并在24小时无人干预情况下完成超过850个餐巾的折叠;针对新任务,所需后训练数据不到一小时。

这些数字仍需要放到更长周期、更多场景和实际成本中观察,但衡量标准的变化已经十分明确:行业开始用连续运行时间、任务成功率、适配数据量和人工干预频率,而不是单次演示效果评价机器人。

更深一层看,商业部署与通用智能并非完全对立。

过去,人们担心做具体项目会拖累通用模型研发。但Dyna Robotics等团队提出的“研究—部署飞轮”说明,真实部署可以暴露实验室无法预见的问题,也能产生最有价值的长尾数据。部署不只是模型训练完成后的终点,也可能是下一轮训练的起点。

谁先把机器人部署出去,谁就更早获得真实数据;谁能更快消化数据,谁的后续部署成本就更低。这可能成为具身智能时代最重要的飞轮。

05、“ChatGPT时刻”不会在同一天到来

圆桌最后,嘉宾们给出的时间判断从两年到五年不等:姚卯青判断两年,Sunday Robotics赵子豪认为三年以内,马也骋判断四年,任至意认为四五年,张正友给出了三到五年的区间。

机器人未必会复制ChatGPT在某一天突然席卷所有人的路径。大家口中的“ChatGPT时刻”其实未必指向同一个终点。

ChatGPT是一项纯软件产品,只要服务器准备好,几乎可以瞬间触达全球用户。机器人受到制造产能、硬件成本、供应链、安全标准和现场维护的共同限制,不可能通过一个网页完成全球分发。

物理AI更可能是分层涌现。

试想一下,首先出现的,会是在工厂、仓储、后厨等环境相对结构化、任务价值明确的场景;随后进入商超、酒店、养老等半开放环境;最晚成熟的,很可能才是变量最多、容错要求最高的家庭。

因此,具身智能真正值得关注的,是谁能同时建立模型能力、数据基础设施、仿真评测、机器人本体和真实部署网络。

在这场竞争中,中国公司的优势在于制造业场景密集、供应链完整、工程落地速度快;下一步要回答的,则是这些场景能否沉淀出跨本体、跨行业复用的模型能力。

当越来越多机器人在真实世界里持续工作,并把每天遇到的成功、失败和意外重新变成训练材料时,物理AI的智能涌现已经在发生,只是速度不一,地点不同。

本文来自微信公众号“吴怼怼”,36氪经授权发布。

(5)

小72
小72 1周前

感觉数据就像做菜的配方,单一来源解决不了问题,形成好的数据结构才能让具身智能发展得更好。

0
知我
知我 1周前

‘ChatGPT时刻’不会同一天来,具身智能分层涌现合理,中国公司有优势,就看沉淀能力了。

0
超超
超超 1周前

从演示到产品差距大,现在用运行时间等指标衡量,更实际了。商业部署会成重要推动力。

0
陈小胖啊

这文章分析得挺细。看来具身智能竞争侧重变了,数据等基础设施特重要,行业路还长,得慢慢推进。

0
罚站30年

VLA和世界模型融合是趋势啊,跨本体迁移要是成了,机器人行业能有大发展。

0

英伟达合作伙伴广达电脑寻求发行全球存托股票筹资不超22亿美元

人工智能服务器制造商广达电脑计划通过发行全球存托股票(GDS)筹资至多21.9亿美元。这家英伟达合作伙伴拟发行4900万份证券,每份发行价介于43.91美元至44.77美元。

澜起科技:首次回购50万股A股股份 支付金额约1.03亿元

澜起科技(688008.SH)公告称,2026年7月29日,公司通过集中竞价交易方式首次回购A股股份50万股,占总股本0.04%,回购金额约1.03亿元,价格区间为192.18元/股至210.00元/股。

北交所、全国股转公司启动全国重点专精特新企业培育专项行动

由北交所、全国股转公司联合江苏省委金融办、江苏省工信厅、江苏证监局主办,江苏股权交易中心协办的全国首场重点专精特新企业培训活动7月29日在南京举办。拉开了“全国重点专精特新企业培育专项行动”的序幕。本次活动坚持政策解读与实操指导“双轮驱动”理念,通过系统宣介工信、金融部门支持专精特新企业赴新三板、北交所挂牌上市的政策举措,深度解读区域性股权市场、新三板、北交所全链条服务专精特新企业成长的机制安排,深入剖析企业筹备挂牌上市过程中的常见问题并提供解决方案,旨在推动更多优质专精特新企业依托北交所、新三板市场实现高质量发展,完善覆盖专精特新企业成长全周期的梯度培育生态。参训企业表示,培训内容丰富务实,为企业科学规划挂牌上市路径提供了清晰可循的“导航图”。下一步,北交所、全国股转公司将发挥“工信部-交易所-地方金融部门-区域性股权市场”多方共育专精特新的服务机制,在全国范围内陆续开展专项行动系列活动,持续提升针对重点专精特新企业的管家式服务水平,为服务构建现代化产业体系和实体经济高质量发展积极贡献力量。

财通福鑫定开混合:将于7月30日开盘起至当日10:30停牌

财通基金管理有限公司公告,截至2026年7月29日上海证券交易所收盘,旗下财通多策略福鑫定期开放灵活配置混合型发起式证券投资基金(场内简称:财通福鑫定开混合,交易代码:501046)二级市场交易价格明显高于基金份额净值,出现较大幅度溢价。特此提示投资者关注二级市场交易价格溢价风险,投资者如果盲目投资,可能遭受重大损失。为维护投资者利益,本基金将于2026年7月30日开盘起至当日10:30停牌。

澜起科技:首次回购50万股A股股份,回购金额约1.03亿元

澜起科技公告,2026年7月29日,公司通过集中竞价交易方式首次回购A股股份50万股,已回购股份占公司总股本的比例为0.04%,购买的最高价为210.00元/股、最低价为192.18元/股,支付的金额总额约为人民币10276.49万元(不含佣金、过户费等交易费用)。

伊朗谴责美国沙特袭击伊拉克

据CCTV国际时讯,伊朗外交部今天(7月29日)发表声明,强烈谴责美国和沙特对伊拉克部分地区发动袭击。声明称,这些袭击侵犯伊拉克国家主权和领土完整,违反《联合国宪章》和国际法,目的是“服务于美国和以色列政权扩大西亚地区战争和冲突范围的图谋”。声明还称,袭击造成多名伊拉克民众死亡,伊朗对此表示哀悼,并重申对伊拉克政府和人民的支持。声明同时表示,美国及其地区盟友应对“这些罪恶、不人道和挑衅行为”所造成的后果承担责任。

知情人士:霍尔木兹海峡仍然完全封闭

7月29日,据伊朗媒体Fars News,一位军事知情人士表示,霍尔木兹海峡仍然完全封闭,任何船只都没有权利通过这一战略水道。任何试图通过的船只,特别是那些不理会警告的船只,将会面临果断和迅速的反应。

伊媒称美空袭伊朗与伊拉克边境地区

7月29日,据伊朗国家电视台,当地时间7月29日下午,伊朗西阿塞拜疆省皮兰沙赫尔市边境地带遭到美国空袭。

匈牙利议会投票决定取消该国关于加密货币交易验证的要求

7月29日,据The Block报道,匈牙利财政部长安德拉斯·卡尔曼(Andras Karman)表示,匈牙利议会投票决定取消该国关于加密货币交易验证的要求。这项废除措施属于一项更广泛税收方案的一部分,它取消了在进行特定加密货币兑换之前必须验证钱包所有权、资产来源及客户数据的义务。

卡布里贷款与OpenAI展开合作 将企业级AI应用于借贷业务运营

7月29日,卡布里环球资本有限公司旗下卡布里贷款与OpenAI展开合作,将企业级人工智能应用于借贷业务运营。