风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

当“第一”比机器人还多:具身智能榜单的可信度危机与破局路径

摘要

具身智能赛道持续吸引资本目光的同时,各类相关榜单也越来越多。当“第一”几乎成为各家标配时,榜单还有可信度吗?一个多月前,千寻智能就经历了尴尬时刻。6月初,其具身基座模型Spirit v1.6在RoboArena榜单上以1918...

当“第一”比机器人还多:具身智能榜单的可信度危机与破局路径
具身智能赛道持续吸引资本目光的同时,各类相关榜单也越来越多。当“第一”几乎成为各家标配时,榜单还有可信度吗?一个多月前,千寻智能就经历了尴尬时刻。6月初,其具身基座模型Spirit v1.6在RoboArena榜单上以1918分的成绩超过了英伟达Cosmos3的1880分,一度位居“世界第一”;紧接着,千寻宣布完成15亿元A+轮融资,三个月内累计完成四轮密集融资,总额接近50亿元,创下具身智能赛道的融资频率新高。不过,业内对评测数据的质疑几乎从次日就开始升温。有观察者指出,在310次评测记录中,有72%的分数来自两个账号。更值得关注的是,RoboArena官方随后发布声明,经回溯调查后移除了部分存疑的评测数据,并更新了榜单排名。Spirit v1.6也随之从榜单上除名。但这一事件并未浇灭玩家们的热情。翻开近半年的行业动态,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明……几乎每一家头部公司手里都攥着一个“第一”,且这些“第一”维度各不相同。这一景象或许不难理解:具身智能目前技术路线尚未统一,真机任务成功率普遍卡在50%—60%,外界判断一家公司实力,很大程度上只能依赖榜单。可当发榜方既有高校、研究机构,也有媒体甚至咨询公司,标准不一、机制不明、部分榜单还隐含商业合作时,“榜单是否还能当尺子用”,就成了真问题。一位长期跟踪该赛道的投资人坦言,榜单更偏市场行为,最多算投资决策的一个参考。他对于千寻事件并不吃惊。在他看来,真正在意名次的,往往不是以财务或技术为出发点的机构,而是一些地方引导基金或偏国资背景的资金——一个“第一”,可能正是他们“写在报告里一个比较好的入口”。但也有投资人持不同看法:在技术门槛高、信息严重不对称的早期阶段,榜单至少提供了一个横向比较的起点。当“第一”的数量比认真做机器人的公司还多时,这些榜单到底是在测技术,还是在测讲故事的能力?哪些榜单还值得看?我们先来盘一盘目前市面上的榜单,建立一个大致印象。据不完全统计,当前具身智能的活跃榜单已有20余个。按评测内容,这些榜单大致可分为三类:VLA操作综合榜,考察机器人能否真实执行任务,以任务成功率为指标,代表是RoboChallenge Table30、MolmoSpaces;世界模型榜,考的是模型对物理世界的内部推演能力,不依赖真机动作,代表是World Arena和WorldModelBench;专项基准榜,聚焦单点极端能力,如双臂协同、仿真到真机迁移、强扰动鲁棒性等,代表是RoboTwin 2.0、SimplerEnv、LIBERO 和 CALVIN。它的价值在于,把模型在综合榜照不到的边界场景中的短板逼出来。需要说明的是,这三类榜单各有侧重、互不替代:真机榜测执行、世界模型榜测推演、专项榜测边界。没有任何一个榜单能覆盖具身智能的全部能力维度。有了这层坐标,近半年具身基座模型的战报就能对号入座。今年5月,星动纪元Era0宣称拿下RoboChallenge Table30第一;智元GE-Sim 2.0是World Arena Track1第一;跨维DSCFuncWorld是World Arena Track2第一。进入6月,千寻Spirit v1.6曾登顶RoboArena(后被除名),鹿明Prime R0登顶MolmoSpaces。几乎每一家都是第一,而且都有具体榜单排名作背书。而乱象,也正是从各种榜单开始的。最明显的是,榜首像流水席,“第一名”更换频繁。RoboChallenge Table30的榜首过去半年至少换了四次:先是千寻Spirit v1.5以50.33%的成功率刷新纪录,很快又被极佳视界GigaBrain-0.1、波士顿动力Atlas、星动纪元Era0先后超越。这个速度远超大语言模型主流榜单——GPT-4、Claude 3等在MMLU、GSM8K上常霸榜数月甚至一年。“当下的具身智能,单个模型能霸榜一周就算不容易。”一位头部具身智能公司从业者表示。他将主要原因归结为两点:一是物理世界的随机性——同一模型在真机上跑两次,成功率差三到五个百分点很正常,光照、物体位置、机械臂公差都会影响结果;而MMLU这类榜单是固定题目、确定性判分,分数高度稳定。二是测试任务的公开程度——如RoboChallenge的Table30,30项任务分布完全公开,各家可针对性采集数据、微调模型再提交,“榜首保质期”于是被压缩至以周计。更让人迷惑的,是同一个榜里会同时冒出好几个“第一”。World Arena就是典型:智元GE-Sim 2.0在Track1(感知与动作响应)以68.26分排第一,跨维DSCFuncWorld在Track2(数据引擎)排第一。两者都自称“登顶World Arena”,对外却未注明赛道差异。对不熟悉细分划分的读者而言,这种表述极易造成混淆,甚至误判为数据造假——其实谁都没说错,只是不够精确。还有一层更模糊的地带是榜单性质混杂,“第一”的含金量却被默认成同一档,容易产生误导。一些公司对外口径中,常并列出现“某模型在RoboChallenge排名第一”和“在某具身智能媒体测评中也位居第一”。前者是7×24小时真机跑出的成功率,后者可能只是编辑部闭门讨论或商务合作敲定的名单。两者被并排放进一句话,含金量却被默认划等号。其中最模糊的是“产业榜”:有些榜单顶着“产业”二字,但既非真机锁死的硬榜,也无学术机构背书,而是咨询公司或媒体合办的打分榜。类似情况曾在大语言模型圈出现过,但随着学术榜、商业测评、媒体榜逐步分层,“双料第一”才慢慢被拆解。而具身智能,眼下正处在那个尚未分层的混沌期。三种现象叠加,结果就是榜单“第一”严重通货膨胀。而且这种通胀不只停留在营销层面——一个“第一”的头衔,往往能换来关注度、资源倾斜,甚至实打实的估值溢价。既然榜单能撬动真金白银,如何把“第一”造出来,也形成了现实路径。业内人士介绍,虽然千寻Spirit v1.6属于极端个例,但行业里“造第一”的现象并不少,手法大致有三类:成本最低、也最普遍的一种是话术包装:“单科第一”成了“总分第一”,核心是省掉关键限定词。比如实际拿的是“RoboTwin 2.0双臂协同VLA类Clean档第一”,对外就变成“登顶RoboTwin 2.0”;实际是“LIBERO-Plus场景泛化专项第一”,对外就成了“LIBERO-Plus榜首”。数据没造假、成绩也是真的,但“第一”所指代的范围被人为放大。第二种方式是利用“刷题”等方式直接干预结果。一条是“照着考题练”:榜单公开的任务分布、评分标准、环境参数,都可以拿来做定向后训练。在任务相对固定的榜单上尤其明显,各家可通过反复“刷题”、过拟合特定场景换取高分。业内人士指出,这在具身圈被视为正常迭代,与LLM领域的“数据污染”有本质区别。另一条是钻评测机制的漏洞。例如RoboArena采用开放注册、分布式评测,本意是鼓励参与,却留下三个空子:一是评测者身份无门槛,任何人都能注册当裁判,短期内大量新账号集中评测同一模型,即可快速拉高Elo分数;二是匹配不强制全覆盖,随机分配对手不等于必须跟同期在榜者都打一轮,样本不足时两个模型可能零交手;三是集中刷评,用多个账号密集评测自家模型,降低负面记录权重。Spirit v1.6的310次评测中,72%来自两个账号,224场评测刷出97%胜率,而英伟达用同样条件自测21次,胜率0%——两组数据并置,直接引发广泛质疑。事后,RoboArena补全规则:评测者须为无利益关联的第三方;评测完成率低于20%的账号标为可疑;并封禁自刷入口。处理后,千寻跌出榜单。第三种方式最隐蔽也最泛滥,是资源置换,把榜单直接做成生意。不少媒体榜评选标准不透明,有的干脆与被评对象存在商务合作,双方联合发布“权威报告”,将媒体榜与学术benchmark并排包装。它不涉及技术,也不涉及数据,只涉及预算和关系。不止一位从业者证实,刷榜、买榜等现象并不少见。这三种手法往往叠加使用:先靠针对性训练或钻空子把分数刷上去,再用赛道偷换掩盖来源,最后用话术对外传播,必要时再买个媒体榜背书。层层包装之下,“第一”就成了。这些手法在行业内部并不是秘密。真正的问题在于,看穿它们需要一定的技术功底;技术越复杂,外行越难分辨,故事就越容易讲。不止一位具身智能从业者坦言,他们当下已不太关注榜单排名——因为榜单能刷、能买,即便一切合规,物理环境的复杂性也让数据很难做到百分百准确。更深一层的问题是,这个行业目前还没有一把“通用的尺子”。有从业者用“炒鸡蛋”和“拌凉菜”打比方:机器人A擅长炒鸡蛋、成功率90%,机器人B擅长拌凉菜、成功率85%,但不能就此说A比B强。炒鸡蛋考验抓取和翻锅,拌凉菜考验精准倒料和搅拌,两件事技能不同、难度不同、评价标准也不同。当下的具身智能赛道,尚无统一标准能把不同能力折算进同一个打分体系。不过,这不代表榜单一无是处。从业者普遍认为,榜单仍有其参考价值,关键在于知道什么值得看,以及看完之后还该看什么。综合业内共识,真正可信的榜单,大体同时具备三个特征:一是分项透明,不是只甩一个“第一”。不论综合榜还是专项榜,可信的做法都是把细项一一拆开。以RoboChallenge Table30为例,它测30项日常任务的综合成功率,可信之处在于不仅给出64.33%这个综合数字,还让读者看到30项中哪几项做得好、哪几项掉链子。只报总分、不报细项的榜单,价值要大打折扣。二是评测由第三方掌控,且有反刷题设计。MolmoSpaces不允许微调,模型直接“裸考”;LIBERO-Plus则加入光照突变、背景杂乱、相机角度变化等极端扰动,专门防止靠死记硬背拿分。它们的共同特点,是让刷题变难,让泛化成为真正的门槛。三是看评测机制,而不是看更新频率。更新慢的榜单不一定可靠,更新快的榜单也不一定可刷。有些榜更新慢,是因为真机评测成本极高——RoboChallenge一次完整评测周期可能需数周,30项任务每项跑10次,共300次真机尝试,7×24小时连续运行,这是物理世界的硬约束;而有些榜更新快,则是机制设计使然,如RoboArena采用Elo动态排名,每天有新对战数据进来,自然日更。这种快本身不是问题,它的可信度取决于机制是否严密、漏洞是否被补上。但是,既然圈内都知道榜单有水分,为什么大家还在拼命刷?答案在于行业当下的阶段。眼下这场“第一”的争夺战,本质上是资本焦虑的产物。今年是具身基座模型密集迭代的一年,早期赛道出货量、营收、订单量都不稳定,只能拿榜单顶上。融资导向的阶段没变,刷榜这件事就不会停。当行业进入下一阶段,评判的标尺会自然切换——例如每年交付多少台、有哪些稳定客户、是否实现盈利。到那时候,“第一”的通货膨胀会自然消散,榜单也会退回它本该在的位置。或许,那些不忙着刷榜、只顾着把机器人送进产线的公司,才是行业真正的答案。

评论 (10)

登录 后即可发表评论
沐沐林
沐沐林 1周前

这榜单跟大语言模型榜单比差远了,各种造假刷榜,真希望早点规范起来,让其回归正常作用。

0 回复
꧁花ℒ开ℴ不v见ℯ花꧂²⁰²⁶

榜单标准不一,同一榜单能有好几个‘第一’,容易误导人,筛选榜单得仔细看特征。

0 回复
远航
远航 1周前

刷榜风气不好,不利于行业发展,踏实做技术才是关键,榜单等行业成熟了再看也不迟。

0 回复
胖胖诺的爸爸

这榜单太乱了,各种‘第一’满天飞,标准不统一,还能随便刷,真没法当参考。

0 回复
小江
小江 1周前

虽有乱象,但榜单也不是完全没用,能给不了解的人一个横向比较的起点,好坏得自己判断。

0 回复
更多