具身智能下半场:当机器人的大脑开始重新学习物理世界
摘要
今年,具身智能步入第三个年头,行业的焦点正从“身体”转向“大脑”。过去两年,人形机器人本体能力突飞猛进:灵巧手更精准、运动控制更稳定、整机设计更成熟。它们登上春晚舞台完成武术与舞蹈表演,也陆续走进工厂、仓...
今年,具身智能步入第三个年头,行业的焦点正从“身体”转向“大脑”。
过去两年,人形机器人本体能力突飞猛进:灵巧手更精准、运动控制更稳定、整机设计更成熟。它们登上春晚舞台完成武术与舞蹈表演,也陆续走进工厂、仓库和零售门店,开始承担真实任务。但当机器人真正踏入动态、开放、不可预设的物理世界,一个根本性瓶颈迅速暴露——空有敏捷的四肢,却缺乏能实时感知、持续推理、自主决策的“大脑”。
瓶颈不在动作,而在理解。
在高度结构化的示范场景中,机器人可通过大量真机示教完成标准流程。可一旦传送带速度微调、桌面物品被挪动、货架偏移几厘米,甚至出现从未见过的障碍物,系统便极易“卡死”。企业不得不反复采集新数据、重新示教、再训练——这种依赖人工干预的闭环,无法支撑规模化落地。问题根源在于:当前主流技术路径仍以模仿学习为主,本质是“记动作”,而非“懂因果”。它难以泛化,更无法让机器人像人一样,在行动中持续观察、预测、调整。
世界模型,成为破局的关键共识。
越来越多从业者意识到,真正的突破点不在本体迭代,而在构建能理解物理规律的“世界模型”。这类模型不追求生成文本或图像,而是学习动作如何影响环境、力如何传递、物体如何响应——即建模物理世界的内在因果逻辑。全球科技力量正加速汇聚于此:英伟达推出Cosmos与Isaac GR00T体系,Google DeepMind发布Gemini Robotics。国内融资数据亦印证趋势——截至今年6月中旬,具身智能赛道融资约438亿元,超半数流向聚焦基础模型与世界模型的“大脑派”,而传统本体公司融资占比已不足15%。
分歧随之浮现:机器人大脑,该不该另起炉灶?
面对物理世界这一全新学习对象,行业迅速分化为两条路径:一派延续大模型范式,在通用模型基础上迁移、微调;另一派则主张彻底重构——因为互联网数据与物理交互在数据形态、学习目标、运行约束上存在本质差异。前者是“修旧如旧”,后者是“从零筑基”。这场关于底层范式的争论,标志着具身智能正进入深水区。
蚂蚁灵波给出的答案是:“具身原生”。
7月7日至10日,蚂蚁灵波连续发布六款模型,覆盖视觉、深度、视频、世界模型、跨模态动作理解与具身智能体全栈层级。这不是常规的产品升级,而是一次系统性范式宣言。“具身原生”意味着:模型必须从第一天起,就以机器人为中心、以物理世界为教材、以实时交互为训练方式。它拒绝将互联网大模型简单移植,而是围绕机器人“看—想—干”的完整闭环,重构数据、架构与训练目标。
看得清:用原生空间智能重建感知入口。
LingBot-Vision与LingBot-Depth 2.0并非通用视觉模型,而是专为机器人传感器适配的空间智能模型。它们直接处理多视角RGB-D、IMU、关节反馈等真实输入,让机器人“看见”的不是像素,而是三维空间中的可操作关系与物理约束。
想得明:用因果预训练重塑模型内核。
LingBot-Video引入MoE架构提升效率;LingBot-World 2.0通过因果预训练(Causal Pretrain)强制模型学习“推箱子→滑行→停止”这样的物理链路;而压轴发布的LingBot-VA 2.0,则集大成地实现语义分词器、因果建模、MoE轻量推理与前瞻推理(Foresight Reasoning)四重融合——让模型不仅能预测下一帧,更能同步推演动作后的环境演变,并据此动态修正行为策略。
干得准:用原生数据打通理解到执行的最后一公里。
LingBot-VLA 2.0不再依赖人工标注的动作序列,而是从真实产业任务中反向驱动数据采集,适配多构型机械臂、高自由度灵巧手,并强化语义指令与动作空间的端到端对齐。新一代VAE结构使“打开抽屉”这类抽象指令,可稳定映射为关节扭矩、指尖力控、路径规划等具体参数,显著缩小“理解”与“执行”之间的鸿沟。
这不仅是技术迭代,更是学习范式的切换。
LingBot-VA 2.0采用从头预训练(Full Pre-training),以自回归视频生成为底座,直接学习机器人与物理世界交互产生的原始时序信号。它不预测画面,而建模动作-状态-反馈的闭环因果;它不等待推理完成,而通过异步机制实现“边看、边想、边动”;它不要求海量标注,而依靠少量新场景数据即可快速适配复杂任务——动态抓取、桌面对抗、连续装配皆可应对。其背后逻辑清晰而坚定:机器人不是语言模型的子集,它是物理世界的原住民,理应拥有自己的学习语法、数据基础设施与计算范式。
真正的挑战,才刚刚开始。
机器人没有属于自己的“互联网”。真实交互数据天然稀缺、昂贵、非标,这决定了其智能增长无法复刻大模型的爆发曲线。因此,“具身原生”不仅是一种技术选择,更是一种系统性突围思路——它试图通过全栈原生设计,压缩数据依赖、提升泛化效率、拉通产业反馈,最终走出一条可持续演进的具身智能路径。当整个行业还在争论“大脑该长什么样”时,蚂蚁灵波已率先交出一份可验证、可扩展、可落地的答卷。答案是否唯一,尚待时间检验;但问题已被重新定义,方向已然清晰。
评论 (5)
机器人在真实场景易‘卡死’,主流技术难泛化,蚂蚁灵波‘具身原生’围绕机器人闭环重构,值得关注。
行业焦点转向机器人大脑,世界模型成关键,蚂蚁灵波‘具身原生’是新范式,能否成功还得看后续。
现在机器人缺的就是‘大脑’,世界模型是破局点,但两条路径还在争论,蚂蚁灵波的‘具身原生’思路有点意思。
具身智能进入深水区,数据稀缺是难题,蚂蚁灵波‘具身原生’压缩数据依赖,或许是条出路。
具身智能从‘身体’到‘大脑’转变,瓶颈在理解物理世界,蚂蚁灵波的模型覆盖全栈层级,有机会突围。