风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

人形机器人能力跃迁:从硬件比拼到隐式世界动作模型

摘要

人形机器人正跨越能力临界点 过去两年,人形机器人赛道的竞争重心已悄然转移——不再仅比拼关节精度、电机响应或翻跟头的流畅度,而是聚焦于模型能否真正理解物理世界、预测环境演化,并协调全身完成复杂任务。整机性...

人形机器人能力跃迁:从硬件比拼到隐式世界动作模型
人形机器人正跨越能力临界点 过去两年,人形机器人赛道的竞争重心已悄然转移——不再仅比拼关节精度、电机响应或翻跟头的流畅度,而是聚焦于模型能否真正理解物理世界、预测环境演化,并协调全身完成复杂任务。整机性能是基础,但决定其通用上限的,是背后的世界建模与动作生成能力。 三大瓶颈制约发展 行业共识正在形成:当前人形机器人面临三重结构性难题。第一,真机演示数据采集成本极高——需同步记录第一人称视频、本体感知信号与可执行全身指令,受限于遥操作难度、安全风险、硬件稀缺及环境多样性,难以规模化积累高质量数据。第二,主流世界动作模型多依赖像素级视频预测,算力消耗大,且大量资源被无关画面细节占用;而人形机器人高速运动带来的视角抖动,进一步加剧视觉预测噪声。第三,多数方案仍将上肢操作与移动控制割裂建模,上下半身协同不足,无法支撑自然、连贯的全身作业。 Being-M0.7:首个全身移动操作隐式世界动作模型 在此背景下,具身智能公司智在无界发布Being-M0.7——全球首个面向人形机器人全身移动操作(loco-manipulation)的隐式世界动作模型(Latent World-Action Model)。它首次将隐式世界模型能力,从桌面级灵巧操作扩展至包含行走、转向、负重、避障在内的全身体态协同场景。 技术路线一脉相承 Being-M0.7并非孤立突破,而是其长期技术路径的延续。早在2023年,团队即提出“从人类行为中学习世界”的核心判断:机器人真机数据昂贵且增长缓慢,而人类每天以第一人称视角与物理世界交互所产生的海量行为数据,天然蕴含场景演化、物体动力学与身体协调的丰富先验。与其等待机器人数据自然积累,不如让模型先学会‘世界如何运行’,再迁移适配到具体本体。 今年4月发布的Being-H0.7已验证该路径在灵巧操作侧的有效性——基于20万小时人类视频训练,在6项国际评测中综合排名第一,覆盖跨本体、跨场景、连续动态、流体、柔性物体、物理规律与上下文推理七大维度,成为首个原生具身隐式世界模型。 Being-M0.7则将这一能力推向更深层:它回答的不再是‘手如何操作’,而是‘整个身体如何在世界中协调移动与作业’。这涉及‘去哪里、朝向如何、手脚如何配合、姿态如何稳定’等高度耦合的时间与空间决策问题,正是通用人形机器人必须跨越的能力关口。 隐空间建模:轻量、鲁棒、语义聚焦 Being-M0.7采用隐式建模而非像素级预测。它在隐空间中联合预测未来环境状态与紧凑的全身运动表征,将建模焦点集中在语义状态、物体布局与场景演化等真正影响控制的关键结构上。此举既保留世界模型预判未来的核心能力,又显著降低计算开销,规避了第一人称视角下剧烈运动引发的视觉噪声干扰。 真机验证:四类高难任务落地 模型能力最终回归真实场景。团队围绕Being-M0.7完成四项真机Demo,覆盖液体交互、镜像推理、长程任务与遮挡避障四大挑战性场景: 鱼缸捞鱼:机器人需理解水体折射、浮力阻力与工具动力学,在视觉扭曲条件下协调手持网具完成动态捕捞。5次测试成功3次,优于对比模型。 镜像取物:面对仅背面/侧面开口的盒子,机器人须通过前方镜面反射推断隐藏物体三维位置,再接近抓取。在0.5米与1米两种距离下共测试10次,成功4次,显著领先同类方案。 移动置物取物:连续完成行走、抓取、转移、转身等多阶段动作,全程保持场景理解与物体空间推理,检验长程任务中的状态一致性与全身协同。 搬箱避障:怀抱箱子行进中实时识别障碍,不中断运动,通过侧身调整姿态穿越狭窄间隙,同步维持负载平衡与物体稳定——将多向移动、避障与负重控制统一于同一闭环行为。 这些任务共同表明:机器人不再依赖预设轨迹开环执行,而是持续融合当前观测、实时反馈与未来预测,动态生成并修正全身动作。 Mixture-of-Transformers架构:破解数据稀缺困局 支撑上述能力的,是Vision-Motion MoT(混合Transformer多模态架构)。该架构为视觉与运动分别设置专属编码模块,同时通过共享注意力实现跨模态交互——既尊重二者数据分布差异,又允许在存在配对数据时充分协同。 由此,模型可统一利用三类数据:视频-运动配对数据(联合学习环境演化与动作轨迹)、纯视频数据(仅优化视觉分支)、纯人体运动数据(仅优化运动分支)。不同模态数据共同约束同一联合分布,无需构建多个割裂系统。 统一运动表征:弥合人类与机器人的形态鸿沟 团队构建了一套人类与机器人共享的统一运动表征:以头部为根节点,标准化坐标系与初始朝向,消除数据源间分布差异;进一步精简为仅保留头部、双手、双脚的关键位姿,既保留交互与接触信息,又有效适配人形机器人29自由度本体。该表征不仅为后训练提供强监督信号,也在推理阶段支持运动层面的实时反馈校正。 轻量后训练:从人类先验到机器人执行 预训练阶段,模型通过流匹配(Flow Matching)目标,基于短时视觉-运动历史与任务指令,联合预测未来状态变化与运动轨迹。真机适配则通过轻量级‘动作专家’完成:它读取Latent WAM的中间隐藏状态作为高层规划上下文,结合实时视觉观测、本体感知与执行进度,生成机器人可直接执行的动作块。整个过程无需海量真机数据,仅需少量遥操轨迹即可完成本体落地。 可扩展范式:通向通用具身智能的新基建 Vision-Motion MoT不仅是Being-M0.7的技术底座,更确立了一种可持续扩展的多模态融合范式。它将模型训练的数据来源,从稀缺的真机演示,拓展至超10000小时混合模态人类行为数据——包括Ego4D、Xperience、HumanML3D等公开数据集及内部采集数据。 更重要的是,它重构了学习顺序:模型先建立对世界动态与人形运动学的通用理解,再将这种理解转化为特定本体的控制策略。这区别于传统模仿学习‘见什么、出什么动作’的映射模式,引入了‘预测未来状态—生成匹配动作’的联合建模层,使行动真正成为理解的延伸。 竞争逻辑正在重塑 Being-M0.7的发布,标志着人形机器人竞争逻辑的实质性转变。当硬件性能趋于收敛,拉开差距的关键,正转向模型是否具备物理世界理解力、能否生成协调的全身动作,以及背后是否拥有可持续扩大的数据体系与训练飞轮。具身智能已站在临界点:真机数据无法指数增长,而人类行为数据,正成为机器人持续进化的新型‘经验基础设施’。 从Being-H到Being-M,智在无界所践行的,是一条让机器人先学会‘看懂世界’,再学会‘走进世界’的路径。当理解成为行动的前提,通用人形机器人,才真正开始走出实验室,走向真实的物理世界。

评论 (10)

登录 后即可发表评论
王晓华
王晓华 2周前

这个可扩展范式不错,把数据来源拓展了,能让机器人持续进化。

0 回复
宝宝蛋
宝宝蛋 2周前

Being - M0.7这成果不错,隐空间建模降低计算开销挺实用,真机验证也有效果。

0 回复
一声惊跳

Vision - Motion MoT架构能利用多种数据,还重构学习顺序,这竞争优势明显啊。

0 回复
乐仪其
乐仪其 2周前

这技术挺厉害啊,从人类行为数据入手解决真机数据难题,感觉是条可行的路,以后机器人应用估计更广。

0 回复
哈木哈木

机器人还得靠模型,硬件只是基础,这模型的物理世界理解力和动作生成能力很关键。

0 回复
更多