模型跑得快、评测跟不上?具身智能“本领”亟待统一“标尺”
摘要
多方共建的常态化具身智能仿真评测平台RoboColiseum正式上线,试图为具身模型建立一套结果可信、过程可复现、且与真机表现高度一致的仿真评测体系。 2026年过半,具身智能模型正在快速涌现。但模型数量的增...
多方共建的常态化具身智能仿真评测平台RoboColiseum正式上线,试图为具身模型建立一套结果可信、过程可复现、且与真机表现高度一致的仿真评测体系。
2026年过半,具身智能模型正在快速涌现。但模型数量的增长并未让行业变得更清晰,恰恰相反,可选方案越多,横向能力对标反而越缺乏统一参照。
过去一年,国内外多家机构陆续发布了具身基座模型和VLA(视觉-语言-动作模型),演示视频中的抓取、放置、倒水、叠衣等操作愈加“丝滑”。
然而,当前具身智能行业始终面临一个现实困境:模型跑得快,评测跟不上。模型的真实能力边界在哪、短板集中在何处,全行业仍缺少一套系统、可信的衡量标尺。
《科创板日报》记者获悉,日前,高校、科研机构、开源社区、机器人企业和模型公司多方共建的常态化具身智能仿真评测平台RoboColiseum正式上线,试图为具身模型建立一套结果可信、过程可复现、且与真机表现高度一致的仿真评测体系。
RoboColiseum项目负责人吴墨在接受《科创板日报》记者采访时披露了两项核心验证数据:平台仿真评测与实机部署的相关性达到89.5%,相同模型在仿真环境与真实世界中的评测差异小于10%。
这一结论并非凭空而来,吴墨介绍,团队基于十几个从简单到复杂的评测任务,每个任务均在真机和仿真环境中各进行了50到100次对照实验,最后通过线性拟合得出89.5%这一相关性。

RoboColiseum平台 Sim2Real实验对比
与传统评测以单一综合成功率概括模型能力的方式不同,RoboColiseum围绕不同能力维度设置多个任务集,考察模型在各个维度中的表现。据了解,RoboColiseum已上线指令跟随、空间理解、扰动适应、通用操作4类能力子榜,以及78个高保真仿真评测任务、覆盖3000 多个泛化的case。
“我们是基于考察机器人在真实世界中完成一系列任务,需要具备哪些不同维度的能力,最终总结出的4类能力子榜。”吴墨向记者解释了这一设计逻辑,“这个评测维度会去考验模型能否听懂指令、能否理解空间世界、能否去抵抗真实世界的扰动,最后完成指令操作的相关任务。”
与此同时,平台还对每项任务做了子步骤拆解,实现失败原因可追溯。评测过程中,系统不仅判定任务最终成败,还会全程记录模型完成的步骤、失败节点,以及在不同场景下的泛化表现。
自内测以来,RoboColiseum已有海内外40多支队伍在平台开展模型训练与评测。吴墨透露,泛化性、长程精细操作等是目前多数模型的短板,后续将补充相关评测维度更新至平台。
事实上,试图补上评测标准短板的并非只有 RoboColiseum。事实上,今年以来,从官方机构到企业,再到学术社区,多方力量正在加速规范具身智能评测标准。
2026年6月1日,由工业和信息化部批准发布的《YD/T 6770-2026 人工智能 关键基础技术 具身智能基准测试方法》正式实施,为具身智能领域首份行业标准。据介绍,该标准规范了在仿真环境和真实环境下,开展具身智能基准测试的环境设置、任务库构建、测试过程和指标计算方法。
在行业标准落地的同时,多家企业也推出了评测平台。光轮智能在北京人工智能创新高地建设推进会上正式发布RoboFinals,基于100项高难度任务构建标准化评测体系;Dexmal原力灵机与Hugging Face共同发起开放式基准测试平台RoboChallenge,平台累计执行的真机测试总量已突破4万次。
国际上,加州大学伯克利分校、斯坦福大学、英伟达等机构联合发起国际公开性具身智能机器人策略评测平台。该平台采用分布式、众包的真实世界评估网络,通过超过600次双盲真实机器人评估对比验证方法有效性。
尽管各方力量加速入局,但具身智能评测领域距离形成像大模型领域MMLU、GSM8K那样的统一基准,仍有很长的路要走。
具身评测为何如此之难?本质差异在于评测对象的属性不同。大模型的评测以静态的问答数据集为主,跑一遍就能对比得分。但具身模型的评测需在动态的物理世界中进行,难以压缩成一组标准问答。真机测试虽是最可靠的方式,但成本极高,一台人形机器人动辄几十万,还需配套测试场地、运维工程师与长期调试周期等。
此外,仿真评测最大的痛点还在于Sim2Real gap(仿真到现实鸿沟)。光照变化、物体位置偏移、材质差异等现实因素,都可能让一个在仿真测试中表现良好的模型,在实际部署时出现“水土不服”。
吴墨同样指出,具身行业对模型还没有一个统一的、权威的评测榜单。主要由于行业和模型发展太快,大部分评测基准推出后不再更新,无法跟上模型迭代的节奏;同时,仿真与真机之间的gap如果过大,评测结果也难以真实反映模型表现。
具身智能正处于从实验室演示迈向规模化落地的关键节点,评测体系作为产业发展的核心基础设施,重要性正日益凸显。从官方标准落地到多方平台相继入场,行业正在共识形成的路上加速探索,《科创板日报》将持续关注。
评论 (10)
要不是评测这么难,行业也不用这么多人发力了,希望能早点搞出标准来。
这平台看起来挺牛,能解决评测难题最好。但仿真和真机总有差距,不知道最后效果咋样。
评测跟不上模型,发展会受限。这个平台要是有用,行业发展能更稳。
真机测试成本降不下来,统一标准就难。感觉还得等技术再发展发展。
统一标尺很重要,不然模型好坏都没法对比,期待这个平台有好结果。
多方都在搞评测,说明大家都意识到问题了,但要形成统一基准,还早着呢。
这平台数据还挺好看,但Sim2Real鸿沟不解决,还是难真实反映模型能力。
行业在努力了,挺多人关注评测的。但到统一基准,肯定还有好多工作要做。
建评测体系是好事,可真机测试成本高,仿真又有鸿沟,统一标准太难搞。
前面的评测基准不更新可不行,得跟上节奏,这个新平台得注意这点。