小米开源具身生成模型U0:为机器人打造高效数据生产线
摘要
小米将大模型能力深度融入机器人研发底层 7月15日,小米正式发布并开源具身生成模型Xiaomi-Robotics-U0(简称“U0”)。该模型参数量达380亿,首次将具身世界建模与通用图像生成能力统一于同一套多模态自回归架构中,...
7月15日,小米正式发布并开源具身生成模型Xiaomi-Robotics-U0(简称“U0”)。该模型参数量达380亿,首次将具身世界建模与通用图像生成能力统一于同一套多模态自回归架构中,核心定位不是替代机器人控制,而是系统性解决机器人训练中最基础也最棘手的问题——高质量、多样化、可扩展的具身数据供给。
机器人要真正学会抓取、搬运、整理等动作,必须在海量真实场景中反复试错与学习。然而,现实采集面临三重制约:一是成本高——每次布设传感器、校准设备、录制多视角视频均需大量人力与时间;二是覆盖窄——危险环境、极端天气、低频交互等长尾场景难以触达;三是迭代慢——更换物体、光照或背景就意味着重采,无法快速响应算法调优需求。
U0的设计逻辑直指上述痛点:它不追求单张图像的视觉惊艳,而专注生成具备物理合理性、动作可迁移性与任务可标注性的多模态数据。已有真机采集的轨迹数据,可在U0中一键替换物体材质、调整光照方向、切换室内/户外背景,无需重新部署硬件;现实中极难复现的‘老人打翻水杯后机器人自主避障+擦拭’等复合场景,也能通过文本指令驱动模型生成带时序、带力反馈标注的交互视频片段。
为支撑规模化数据生产,U0配套推出FlashAR+高速推理加速方案。借助对角并行解码与动态缓存调度技术,模型生成一张1024×1024高清训练图像的时间,由传统方案的450.77秒压缩至5.44秒,提速达82.9倍。这一突破使单台服务器日均可输出数万帧带语义标签的具身训练帧,真正实现‘数据即服务’(DaaS)的工业化流水线能力。
U0首次在一个统一模型中整合四大能力:具身场景生成、具身轨迹迁移、机器人交互视频生成、通用文生图与图像编辑。这四者并非孤立模块,而是构成完整数据增产闭环——先生成多样化的三维物理场景,再将已有动作轨迹迁移到新场景中,接着扩展环境变量(如加入遮挡物或动态障碍),最终生成包含多智能体协作、人机交互、异常响应等复杂过程的端到端训练视频。整条链路无需跨模型调度,显著降低数据合成中的分布偏移与模态割裂问题。
当前具身智能仍普遍受限于数据荒:真实采集成本高、仿真引擎泛化弱、第三方数据集场景单一。U0的开源,并非要取代真机数据,而是成为连接实验室与真实世界的‘数据适配器’——它让少量高质量真机数据产生指数级衍生价值,让中小企业无需自建百万级采集车队,也能获得覆盖工厂、仓储、家庭等多元场景的训练素材。当数据获取不再成为门槛,创新焦点才能真正回归动作规划、实时控制与安全对齐等核心问题。
评论 (10)
模型整合四大能力形成闭环,数据合成问题解决不少。
数据生成能从分钟级到秒级,工业化流水线能力有了。
这U0模型很实用,能贯通数据链路,整体解决问题能力挺强。
小米在机器人研发底层下功夫,这开源会推动行业数据基建。
突破了机器人数据采集的制约,以后机器人发展可能更快。
U0专注生成可训练具身经验,设计逻辑很对痛点。
小米这开源挺牛啊,能解决机器人训练数据难题,有大作用。
开源这事不错,中小企业不用愁数据了,利于行业发展。
有了这数据适配器,创新能更多放到核心问题上了。
数据生成提速这么多,效率提升可不是一点半点啊,对行业帮助大。