风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

世界模型元年:三张新考卷,正在重写AI的评分标准

摘要

这届WAIC,不是比谁发得多,而是比谁敢换考卷 这届世界人工智能大会,1100多家企业参展,300多款产品全球首发。全场最热的词,是“世界模型”。 但热闹之下,藏着一个被反复掩盖的事实:过去三年,世界模型的进展,...

世界模型元年:三张新考卷,正在重写AI的评分标准

这届WAIC,不是比谁发得多,而是比谁敢换考卷

这届世界人工智能大会,1100多家企业参展,300多款产品全球首发。全场最热的词,是“世界模型”。 但热闹之下,藏着一个被反复掩盖的事实:过去三年,世界模型的进展,早已不是“有没有”,而是“怎么评”。 当十几家主流模型在LIBERO基准上全部挤在96分到99分之间,当视频生成效果全靠人眼打分、观众鼓掌即算通过——技术本身没停步,可评价体系,已经失灵。 分数失真,信任就塌方。于是有人开始拆掉旧考场,亲手铺下三张新卷子。出题人不是学术机构,也不是行业联盟,而是一家从游戏AI起步、持续深耕多模态底层模型的公司:昆仑万维。

第一张卷子:物理世界不给过程分

主角叫Riemann-1.0,黎曼动力发布的首代机器人通用大脑。 它在一项基础家务测试中得了零分:叠衣服、收餐具、整理桌面、堆积木——四件事,一件都没完成。 不是不动,是动了;手伸出去了,动作做对约两成,但结果为零。 为什么?因为仿真环境会给“过程分”:手抬得对,给分;方向偏一点,扣一点。真实世界不认这个逻辑。布料会滑、光线会反、力道差毫厘,后续全崩盘。这就是业内常说的“仿真到现实的鸿沟”。 Riemann-1.0的答案,是用23.2万小时人类第一视角日常视频训练——看人叠衣、收碗、插笔、擦桌。86%的数据来自生活录像,剩下才是机器人实操数据。它不是被指令教会做事,而是“看过日子”后自己长出来的理解力。 真机评测结果:四类家务平均成功率85%,比最强开源方案高出15个百分点;在RoboCasa-365(365类厨房全流程任务)中达到62.6%,第二名为54.2%。 更关键的是两个细节:整套系统运行在单张RTX 4090显卡上,硬件门槛一万元出头;从未见过魔方、也未学过收纳盒,十次尝试,十次成功。 这不是优化参数的结果,而是“见过世面”的泛化能力。 这张卷子没有小数点后的荣耀,只有“做完”或“没做完”。它把评分权,彻底交还给物理世界。

第二张卷子:转身之后,楼还在不在

Matrix-3.5,昆仑万维Matrix-Game系列第三代模型,被谢赛宁团队、NVIDIA与浙大联合项目Light Interaction选作底座,也被SANA-WM、RELIC等国际模型列为对比基准。 但它发布时,只说了一个反常数字:帧率从每秒40帧,降到20帧——慢了一半。 行业发布会只有一种语法:“更快了”。它却主动示弱。 原因只有一个:拿速度换记忆。 此前的世界模型像金鱼,转个身,刚生成的楼就消失了,再回头已是新建筑。Matrix-3.5做的,是把每一帧画面标上三维坐标,存入长期记忆档案。你走出去一分钟再回来,楼还在原处,窗户还是那几扇。 为了守住这“一分钟的还在”,工程上把生成步数压到3步,解码器体积砍掉四分之三,最终停在20帧——一个“记性够用、速度可用”的平衡点。 这道题,谷歌Genie 3闭源演示过,Matrix-3.5选择开源实现。它不讨好眼睛,只服务那些把虚拟世界当真的人。

第三张卷子:耳朵听得到的诚实

Mureka,昆仑万维发布的AI音乐模型,技术材料里印着一个刺眼的数字:28%。 一百首生成歌曲中,经专业评审判定“能听、能用、没跑题”的,仅28首。这不是成品率,是“直接可用率”——卡在用户真实使用门槛上。 它没美化,也没模糊。放宽标准,“能听”就升至70%以上;但它坚持三关全过才计数。 因为它清楚:报90%,用户三次就戳穿;报28%,用户三次反而觉得可信。 更坦白的是另一项取舍:为降低“AI味”,主动降低编曲丰满度,在同轮测试中并非最高。理由很朴素——黄晓明在现场分享录音经历时说,AI demo唱得太完美,反而没了呼吸感;太顺滑,就是没人味。 Mureka把“人味”放在精度之上。它不追求榜单第一,而追求和用户手感一致。 这场发布真正的重点,是流水线能力:从一句话灵感出发,自动生成歌词、人声、角色、成片,直至MV。爱奇艺高级副总裁坐在台下——不是来观礼,而是作为首批客户确认接入。

元年不是起点,是计分方式的重启

“2026是世界模型元年”,这句话的深意,不在技术突破,而在评价重建。 机器人的85%,是物理世界盖的章; 那一分钟的“还在”,是三维坐标写的证; 音乐的28%,是人耳听出来的实底。 三张卷子,三种考官:一个铁面,一个较真,一个无法替换。它们共同指向一件事——分数,终于开始算数了。 旧考场里,满分年年有,名次靠对手名单决定;新考场刚铺开,答案尚无标准,但题目真实、判卷诚实、得分可验。 这一行,开始考真题了。

评论 (5)

登录 后即可发表评论
好
1周前

昆仑万维这做法挺务实,不玩那些虚的分数,看实际效果才是硬道理。

0 回复
梵树落菩提

拿评分标准开刀这思路可以啊,昆仑万维这三张卷子挺有想法,让分数变得有意义了,就看后续发展咋样。

0 回复
风在走
风在走 1周前

这改革挺大胆,不管最后咋样,敢这么干就值得关注。

0 回复
长白山上小南门的回忆按钢

老评价体系早该更新了,现在搞出新标准才是真有用,期待后面AI能更靠谱。

0 回复
Mister常
Mister常 1周前

新模式元年换评分标准,有新卷子是好事,希望能推动AI更好发展。

0 回复
更多