世界模型:具身智能的“大脑”正在成形

1 次阅读 2026年07月21日
理解世界,而非模仿动作 想象这样一个场景:你对机器人说‘帮我把洗衣机里的衣服拿出来晾晒’,它看了看洗衣机的门,规划手臂的开门轨迹,缓缓打开舱门,发现衣物缠在一起,它停顿思考一下,重新调整策略,将缠绕的衣物一件件抽出,整理好挂在晾衣杆上。 这个场景之所以令人兴奋,不是因为机器人‘做到了’,而是因为它‘想到了’。它是在理解世界、预测后果、调整行动。这就是世界模型想要实现的东西:让机器像人一样,在行动之前先在脑海里推演一遍——‘我这么做,是否符合这个世界的物理规律?’ 三道墙:数据困境的真实图景 世界模型的本质,是能够理解物理世界运行规律的AI系统,其核心能力在于‘预测世界的下一步状态’。这需要三项关键能力:多模态融合理解,准确感知环境变化;物理规律认知,涵盖动力学与时空关系;因果推理,支撑长时序、不崩坏的逻辑链。 但训练这样的模型,面临三重现实阻碍: 第一道是‘数据墙’——语言模型已用到100万亿Tokens语料,而具身智能所需的真实物理世界数据,信息密度极低,当前积累尚不足千分之一; 第二道是‘表征墙’——跨任务、跨场景、跨本体的统一物理表征仍未建立,同一套理解框架难以适配不同形态的机器人; 第三道是‘闭环墙’——真实环境中试错成本高、反馈慢,难以支撑规模化迭代。 不同团队正以差异化路径破墙:有的采用通用操作接口(UMI)采集低成本、无本体依赖的数据;有的坚持真机采集不可替代,强调数据质量与任务复现一致性;还有的提出‘数据金字塔’结构,将互联网视频、第一人称视角、真机交互、部署回流四类数据分层使用,各司其职。 VLA与WAM:不是取代,而是演进 业内曾出现‘VLA已死,WAM当立’的论调,但实践者更倾向务实判断。VLA(视觉-语言-动作模型)已在跨本体迁移上展现潜力——某通用VLA模型仅在ARX机械臂训练,却能零适配迁移到UR5双臂平台完成同款操作。 而WAM(世界动作模型)则在特定任务中显现出优势:例如餐巾折叠这类对成功率和数据效率要求极高的商业场景,Dyna Robotics发现WAM架构更能兼顾可靠性与泛化性。其思路是——用世界模型做高频状态推演,用轻量推理模型处理高层决策,形成分层协同机制。 腾讯首席科学家张正友指出,具身智能尚无类似Transformer的统一范式。他提出三层认知架构:底层反应系统(快响应)、感知行动系统(中调度)、认知系统(慢思考),信息双向流动,更接近真实智能体的结构。 姚卯青则认为,VLA与WAM并非对立路线,下一代模型将是WRAM(世界推理动作大模型),即融合物理推演、因果理解与动作生成的一体化架构。智元已推出GO-2基座模型、Act2Goal世界模型、GE-Sim2.0仿真引擎,并配套SOP流程库与Genie Evolver百台级真机强化学习系统,打通算法—仿真—真机闭环。 从分钟级迭代到端侧实时推演 训练效率是落地前提。传统单机强化学习迭代周期以‘天’计,而智元在嘉兴部署的Genie Evolver系统,支持超100台机器人并行在线训练:集群实时上报交互数据,云端完成模型更新后,权重2秒内下发至全部终端,训练周期压缩至‘分钟级’。 无界动力选择另一路径:以隐空间世界模型构建‘世界观’,掌握物理规律与因果关系;再以强化学习塑造‘价值观’,将理解沉淀为精准执行策略。该方法不追求像素级视频生成,而在压缩后的隐空间中高效推演未来状态,并驱动动作生成。 推理效率决定机器人能否应对动态现实。大晓机器人发布的开悟世界模型3.1,端侧推理延迟仅125毫秒,使‘理解—推演—执行—反思’闭环可在本体实时完成;蚂蚁灵波的世界模型则在消费级显卡上达成90–150赫兹推理频率,验证了‘为物理世界原生设计’架构的工程可行性。 真实产线,正在成为新展台 部署验证不再是实验室Demo。智元机器人在江西南昌3C产线实现99.99%操作成功率,稳定运行数月;Dyna Robotics在马萨诸塞州餐厅完成餐巾折叠商业验证,24小时无人干预下自主折叠超850个,成功率99.4%;大晓机器人推出面向即时零售、酒店洗衣、巡检安防的三类方案,‘晓满’履约系统已进入烧卖购、快客达等实际零售场景,计划一年内覆盖1000家门店。 这些不是偶发成功,而是可重复、可计量、可交付的业务成果。 关于‘机器人ChatGPT时刻’的时间表,业界预判趋于收敛:姚卯青认为最快两年;任至意与马也骋倾向四年左右;张正友估计为三至五年。共识在于——拐点不在遥远未来,而在持续验证的进程中。 Physical IQ:行业需要一把标准尺子 当前最大缺位,是评测体系的缺失。多数测试仍停留于视频生成质量,却无法衡量模型真正的物理因果推演能力。正如一位CTO所言:‘今天的世界模型,可能99%的像素对决策毫无用处,但我们仍在为它们消耗大量算力。’ Physical IQ物智平台应运而生——这是国内首个具身原生、面向多场景、多本体、多任务的统一评测基准。它不限定硬件形态或算法路径,所有参与者在同一协议下竞技,重点考察双臂协作、移动与操作协同、长程任务规划、3D空间推理、工具使用、多机协同等真实能力维度。 零售场景考货架整理与外卖打包;工业场景考柔性线材整理与工具操作;家居任务覆盖厨房清洁与混合物体整理;物流环节测传送带分拣与重型货箱搬运。每一项任务都源自一线痛点,拒绝‘玩具级’测试。 平台已吸引智元机器人、辉羲智能、蚂蚁灵波等产业链伙伴共建,正从评测工具发展为覆盖产学研用的生态基础设施。

(6)

凉城以北,,,

感觉具身智能前景不错,但数据和评测这些问题得赶紧解决,不然发展会受限。

0
祥云飘四方

真实产线验证成果不错,说明机器人应用越来越靠谱了,未来可期。

0
某东不守法

VLA和WAM不是对立的,融合发展才是方向,姚卯青说得有道理。

0
飞翔󰠇
飞翔󰠇 1周前

世界模型想法挺好,不过那三道墙太难突破了,感觉还得花时间。

0
禾
1周前

行业需要评测体系, Physical IQ平台能解决大问题,赶紧完善起来。

0

花旗将迪士尼目标价从145美元下调至135美元。

花旗将迪士尼目标价从145美元下调至135美元。

花旗将Visa目标价从400美元上调至440美元。

花旗将Visa目标价从400美元上调至440美元。

花旗将康宁目标价从240美元下调至220美元。

花旗将康宁目标价从240美元下调至220美元。

国家网信办就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室会同有关部门起草了《中华人民共和国反网络暴力法(征求意见稿)》,现向社会公开征求意见。

渤健公司股价在公布第二季度业绩后盘前下跌2.2%。

渤健公司股价在公布第二季度业绩后盘前下跌2.2%。

中国-东盟区域医药交易(集采)平台推动国产手术机器人在越南进入临床使用

国家医保局消息,近期,中国-东盟区域医药交易(集采)平台助力国产手术机器人完成越南产品注册并取得上市许可,在越南部分头部医疗机构完成安装并投入临床应用,实现了国产大型医用设备在越南从产品注册到临床应用的重要突破。同时,还将推动中越双方就机器人手术技术培训、临床应用推广、学术交流、人才培养等方面开展深度合作。

花旗将希捷科技目标价从1240美元上调至1300美元。

花旗将希捷科技目标价从1240美元上调至1300美元。

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见。

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见。

韩国金融监管负责人就杠杆型ETF争议致歉 称将恢复市场信任

据报道,韩国主要金融监管机构负责人7月29日就单只股票杠杆型交易所交易基金(ETF)引发的市场争议公开致歉。

维谛技术美股盘前跌超6%。

维谛技术美股盘前跌超6%。