风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

具身智能进入新阶段:从能做,到持续可靠地做

摘要

具身智能正在跨越关键分水岭 在WAIC 2026智启具身论坛上,行业共识正悄然转移:人形机器人虽仍是视觉焦点,但真正被高频提及的关键词已不再是自由度、关节数或炫技式动作,而是数据、模型、仿真、部署、失败反馈与...

具身智能进入新阶段:从能做,到持续可靠地做

具身智能正在跨越关键分水岭

在WAIC 2026智启具身论坛上,行业共识正悄然转移:人形机器人虽仍是视觉焦点,但真正被高频提及的关键词已不再是自由度、关节数或炫技式动作,而是数据、模型、仿真、部署、失败反馈与持续学习。这标志着具身智能正从“证明可行”阶段,迈入“验证可靠”阶段。 过去两年,核心任务是让机器人“能做”——完成一次指令、叠好一件衣服、抓取一个物体;而今天的问题更为严苛:它能否连续执行数百次甚至数千次?换一个光照、地面材质或物品摆放方式,是否依然稳定?失败后能否自主恢复?部署上线后,能力会不会随时间推移而增强? 具身智能的竞争本质,已从单台机器人性能比拼,转向训练系统与数据基础设施的体系化较量。

物理AI的Scaling Law,卡在真实交互闭环

大语言模型的规模增长路径清晰:更多数据、更大参数、更强算力,往往带来更优表现。但物理世界无法被爬取,也无法被无损复制。智元合伙人、觅蜂科技CEO姚卯青将其概括为“三道墙”:数据墙、表征墙、闭环墙。 数据墙,指高质量、带动作意图与环境反馈的真实交互数据极其稀缺且采集成本高昂;表征墙,指不同机器人本体、任务类型与物理场景之间,尚缺乏统一、可迁移的动作与状态表征;闭环墙,则源于真实世界的试错代价——一次失误可能损坏部件、伤及人员或中断产线,远非语言模型输出错误答案那般轻量。 因此,物理AI真正需要规模化的能力,不是静态的数据量,而是“可执行—可评价—可回流”的闭环经验。把一个大语言模型简单接入机器人,不等于具身智能落地。模型需理解“该做什么”,机器人更要解决“如何精准执行”“力度如何控制”“失败如何应对”,以及“动作之后,世界发生了什么变化”。 从数字AI到物理AI,本质是把人类经验转化为机器可复用、可迭代、可泛化的闭环知识。

数据竞争,正从数量转向配方

本次论坛最显著的变化之一,是所有头部团队均已放弃依赖单一数据源。当前主流数据结构呈现金字塔形态:底层是海量互联网视频与人类行为视频,覆盖广、成本低,支撑基础感知与常识理解;中层是第一视角动作数据(如UMI、手持/穿戴设备采集),绕开真机采集瓶颈,捕捉自然动作轨迹;顶层则是真机遥操作数据、实际产线部署数据及失败回流数据——数量最少,却最贴近真实执行逻辑与误差分布。 姚卯青估算,若将具身智能的“ChatGPT时刻”定义为:开箱即用、理解开放式自然语言指令、在常见任务中达成70%–80%基础成功率,则所需真实交互数据量级或将达亿小时。这一量级,彻底否定了仅靠真机采集的可行性。 清华大学苏航副研究员将具身预训练演进归纳为三条主线:数据从单一本体走向多源混合,模型从行为模仿走向世界建模,学习从离线训练走向部署中的持续进化。这意味着未来模型不仅要学“看到什么就做什么”,更要理解任务进展、预测动作后果,并将不同机械臂、人形平台、作业场景的经验压缩为可迁移能力。 数据基础设施由此成为产业链关键一环。觅蜂科技推出的MEgo系列采集终端、MEgo Engine治理平台与AGIBOT WORLD真机数据集,正是试图打通采集—清洗—标注—评测—部署回流的全链路。商业价值也将从“卖数据包”,升级为“定制数据配方+效果验证”——即根据客户任务目标,组合多源数据并实证其对模型指标的实际提升。 值得注意的是,低质量数据的规模化不仅无效,反而有害。一个动作标签偏差、一段未对齐的传感器时序,都可能在训练中固化为执行误差。数据量重要,但跨本体复用能力、真机闭环验证机制,更为根本。

VLA与世界模型,正走向协同融合

曾被视作路线之争的VLA(视觉—语言—动作端到端模型)与世界模型(预测动作对环境的影响再决策),在本次论坛中展现出明确融合趋势。 智元展示的GO-2系统强调“动作思维链”:先做粗粒度任务规划,再交由底层控制器完成高频精细执行;Act2Goal则通过预测中间视觉状态实现“先想后做”。二者融合后的新范式被命名为WRAM(World Reasoning Action Model),即世界推理动作模型。 Physical Intelligence科学家任至意发布的π0.7模型进一步佐证该方向:在ARX机械臂上习得衣物折叠能力后,无需微调即可迁移到UR5双臂机器人上执行同类任务。跨本体迁移能力,是具身智能能否摆脱项目制、走向平台型发展的分水岭。 若每次更换夹爪、基座或关节构型,都要重采数据、重训模型,机器人产业仍将困于定制化交付。只有当不同本体的经验可映射至统一动作空间与状态表征,软件与数据才具备真正的规模效应。 苏航提出的三线演进,最终指向同一目标:构建多时间尺度协同的物理AI系统——上层处理语言与任务理解,中层进行状态预测与长程规划,底层专注毫秒级运动控制与异常响应。这更接近人类神经系统的分工逻辑,而非让单一模型以相同节奏处理所有层级问题。

真正的跃迁,是从‘视频能看’到‘机器能用’

行业曾涌现大量惊艳演示,但演示≠可用。一段叠衣成功视频传播广泛,工厂真正关心的却是:它能否每天连续运行10小时?成功率是否长期稳定在99.5%以上?异常出现时能否自主恢复?维护成本是否低于人力替代收益? 本次论坛首次披露了一批具备产业参考价值的实测数据:智元机器人在江西南昌3C产线连续运行六天、日均超10小时,累计完成近6.5万次操作,成功率达99.99%;Dyna Robotics的DYNA-1商用基座模型,在餐巾折叠任务中成功率99.4%,24小时无人干预下完成超850次折叠,且适配新任务所需后训练数据不足一小时。 这些数字仍需经受更长周期、更多变量场景与综合成本核算的检验,但评价标准已发生根本转变:行业正用连续运行时长、任务成功率、适配数据量、人工干预频次等硬指标,替代单次演示效果。 更深层的共识是:商业部署与通用能力并非对立。Dyna Robotics提出的“研究—部署飞轮”表明,真实场景暴露的问题远超实验室预设,而产生的长尾数据恰恰是最具训练价值的部分。部署不是终点,而是下一轮迭代的起点——谁先规模化部署,谁就率先获得真实世界反馈;谁能高效消化反馈,谁就能降低后续部署门槛与迭代周期。这将成为具身智能时代最核心的增长飞轮。

‘ChatGPT时刻’不会统一到来,但已在分层发生

关于“具身智能何时迎来爆发点”,圆桌嘉宾给出的时间判断从两年到五年不等。但共识在于:它不会像ChatGPT那样,在某一天突然席卷全球。 ChatGPT是纯软件产品,服务器就绪即可全球分发;机器人则受限于制造产能、硬件成本、供应链韧性、安全认证与现场运维体系,注定是渐进式、分层式涌现。 最先成熟的,将是工厂、仓储、后厨等结构化程度高、任务价值明确、容错空间相对充足的场景;随后扩展至商超理货、酒店递送、养老照护等半开放环境;家庭服务则因变量最多、安全要求最高、长尾需求最复杂,必然是最后落地的领域。 因此,真正值得追踪的竞争维度,是企业能否同步构建五大能力:先进模型架构、可扩展数据基础设施、高保真仿真与评测体系、可靠机器人本体、以及覆盖真实场景的部署网络。 中国公司的优势在于制造业场景密度高、供应链响应快、工程化落地效率强;下一阶段的关键命题,则是:这些密集场景能否沉淀出真正跨本体、跨行业、可复用的通用能力? 当越来越多机器人在真实产线、仓库与服务现场持续运行,并将每日的成功、失败与意外,自动转化为新一轮训练素材时,物理AI的智能涌现已然开始——只是它不在同一个时间点,也不在同一个地点。

评论 (8)

登录 后即可发表评论
自在其行

VLA和世界模型融合是趋势,跨本体迁移能力很重要,能让机器人产业摆脱定制化。

0 回复
更新中
更新中 1周前

数据竞争转向配方,低质量数据规模化有害,数据基础设施成产业链关键。

0 回复
朝花夕拾

行业评价标准变了,用硬指标看表现。中国企业有优势,就看能不能沉淀通用能力了。

0 回复
。醉天下。

这文章把具身智能发展讲得挺透。现在竞争重点在体系化,数据配方很关键,还得构建多时间尺度系统。

0 回复
逝水流年

具身智能发展是渐进分层的,先在工厂等场景成熟。企业得构建五大能力才有竞争力。

0 回复
更多