世界模型元年:三张新考卷,正在重写AI的评分标准

0 次阅读 2026年07月20日

这届WAIC,不是比谁发得多,而是比谁敢换考卷

这届世界人工智能大会,1100多家企业参展,300多款产品全球首发。全场最热的词,是“世界模型”。 但热闹之下,藏着一个被反复掩盖的事实:过去三年,世界模型的进展,早已不是“有没有”,而是“怎么评”。 当十几家主流模型在LIBERO基准上全部挤在96分到99分之间,当视频生成效果全靠人眼打分、观众鼓掌即算通过——技术本身没停步,可评价体系,已经失灵。 分数失真,信任就塌方。于是有人开始拆掉旧考场,亲手铺下三张新卷子。出题人不是学术机构,也不是行业联盟,而是一家从游戏AI起步、持续深耕多模态底层模型的公司:昆仑万维。

第一张卷子:物理世界不给过程分

主角叫Riemann-1.0,黎曼动力发布的首代机器人通用大脑。 它在一项基础家务测试中得了零分:叠衣服、收餐具、整理桌面、堆积木——四件事,一件都没完成。 不是不动,是动了;手伸出去了,动作做对约两成,但结果为零。 为什么?因为仿真环境会给“过程分”:手抬得对,给分;方向偏一点,扣一点。真实世界不认这个逻辑。布料会滑、光线会反、力道差毫厘,后续全崩盘。这就是业内常说的“仿真到现实的鸿沟”。 Riemann-1.0的答案,是用23.2万小时人类第一视角日常视频训练——看人叠衣、收碗、插笔、擦桌。86%的数据来自生活录像,剩下才是机器人实操数据。它不是被指令教会做事,而是“看过日子”后自己长出来的理解力。 真机评测结果:四类家务平均成功率85%,比最强开源方案高出15个百分点;在RoboCasa-365(365类厨房全流程任务)中达到62.6%,第二名为54.2%。 更关键的是两个细节:整套系统运行在单张RTX 4090显卡上,硬件门槛一万元出头;从未见过魔方、也未学过收纳盒,十次尝试,十次成功。 这不是优化参数的结果,而是“见过世面”的泛化能力。 这张卷子没有小数点后的荣耀,只有“做完”或“没做完”。它把评分权,彻底交还给物理世界。

第二张卷子:转身之后,楼还在不在

Matrix-3.5,昆仑万维Matrix-Game系列第三代模型,被谢赛宁团队、NVIDIA与浙大联合项目Light Interaction选作底座,也被SANA-WM、RELIC等国际模型列为对比基准。 但它发布时,只说了一个反常数字:帧率从每秒40帧,降到20帧——慢了一半。 行业发布会只有一种语法:“更快了”。它却主动示弱。 原因只有一个:拿速度换记忆。 此前的世界模型像金鱼,转个身,刚生成的楼就消失了,再回头已是新建筑。Matrix-3.5做的,是把每一帧画面标上三维坐标,存入长期记忆档案。你走出去一分钟再回来,楼还在原处,窗户还是那几扇。 为了守住这“一分钟的还在”,工程上把生成步数压到3步,解码器体积砍掉四分之三,最终停在20帧——一个“记性够用、速度可用”的平衡点。 这道题,谷歌Genie 3闭源演示过,Matrix-3.5选择开源实现。它不讨好眼睛,只服务那些把虚拟世界当真的人。

第三张卷子:耳朵听得到的诚实

Mureka,昆仑万维发布的AI音乐模型,技术材料里印着一个刺眼的数字:28%。 一百首生成歌曲中,经专业评审判定“能听、能用、没跑题”的,仅28首。这不是成品率,是“直接可用率”——卡在用户真实使用门槛上。 它没美化,也没模糊。放宽标准,“能听”就升至70%以上;但它坚持三关全过才计数。 因为它清楚:报90%,用户三次就戳穿;报28%,用户三次反而觉得可信。 更坦白的是另一项取舍:为降低“AI味”,主动降低编曲丰满度,在同轮测试中并非最高。理由很朴素——黄晓明在现场分享录音经历时说,AI demo唱得太完美,反而没了呼吸感;太顺滑,就是没人味。 Mureka把“人味”放在精度之上。它不追求榜单第一,而追求和用户手感一致。 这场发布真正的重点,是流水线能力:从一句话灵感出发,自动生成歌词、人声、角色、成片,直至MV。爱奇艺高级副总裁坐在台下——不是来观礼,而是作为首批客户确认接入。

元年不是起点,是计分方式的重启

“2026是世界模型元年”,这句话的深意,不在技术突破,而在评价重建。 机器人的85%,是物理世界盖的章; 那一分钟的“还在”,是三维坐标写的证; 音乐的28%,是人耳听出来的实底。 三张卷子,三种考官:一个铁面,一个较真,一个无法替换。它们共同指向一件事——分数,终于开始算数了。 旧考场里,满分年年有,名次靠对手名单决定;新考场刚铺开,答案尚无标准,但题目真实、判卷诚实、得分可验。 这一行,开始考真题了。

(5)

好
1周前

昆仑万维这做法挺务实,不玩那些虚的分数,看实际效果才是硬道理。

0
梵树落菩提

拿评分标准开刀这思路可以啊,昆仑万维这三张卷子挺有想法,让分数变得有意义了,就看后续发展咋样。

0
风在走
风在走 1周前

这改革挺大胆,不管最后咋样,敢这么干就值得关注。

0
长白山上小南门的回忆按钢

老评价体系早该更新了,现在搞出新标准才是真有用,期待后面AI能更靠谱。

0
Mister常
Mister常 1周前

新模式元年换评分标准,有新卷子是好事,希望能推动AI更好发展。

0

英伟达合作伙伴广达电脑寻求发行全球存托股票筹资不超22亿美元

人工智能服务器制造商广达电脑计划通过发行全球存托股票(GDS)筹资至多21.9亿美元。这家英伟达合作伙伴拟发行4900万份证券,每份发行价介于43.91美元至44.77美元。

澜起科技:首次回购50万股A股股份 支付金额约1.03亿元

澜起科技(688008.SH)公告称,2026年7月29日,公司通过集中竞价交易方式首次回购A股股份50万股,占总股本0.04%,回购金额约1.03亿元,价格区间为192.18元/股至210.00元/股。

北交所、全国股转公司启动全国重点专精特新企业培育专项行动

由北交所、全国股转公司联合江苏省委金融办、江苏省工信厅、江苏证监局主办,江苏股权交易中心协办的全国首场重点专精特新企业培训活动7月29日在南京举办。拉开了“全国重点专精特新企业培育专项行动”的序幕。本次活动坚持政策解读与实操指导“双轮驱动”理念,通过系统宣介工信、金融部门支持专精特新企业赴新三板、北交所挂牌上市的政策举措,深度解读区域性股权市场、新三板、北交所全链条服务专精特新企业成长的机制安排,深入剖析企业筹备挂牌上市过程中的常见问题并提供解决方案,旨在推动更多优质专精特新企业依托北交所、新三板市场实现高质量发展,完善覆盖专精特新企业成长全周期的梯度培育生态。参训企业表示,培训内容丰富务实,为企业科学规划挂牌上市路径提供了清晰可循的“导航图”。下一步,北交所、全国股转公司将发挥“工信部-交易所-地方金融部门-区域性股权市场”多方共育专精特新的服务机制,在全国范围内陆续开展专项行动系列活动,持续提升针对重点专精特新企业的管家式服务水平,为服务构建现代化产业体系和实体经济高质量发展积极贡献力量。

财通福鑫定开混合:将于7月30日开盘起至当日10:30停牌

财通基金管理有限公司公告,截至2026年7月29日上海证券交易所收盘,旗下财通多策略福鑫定期开放灵活配置混合型发起式证券投资基金(场内简称:财通福鑫定开混合,交易代码:501046)二级市场交易价格明显高于基金份额净值,出现较大幅度溢价。特此提示投资者关注二级市场交易价格溢价风险,投资者如果盲目投资,可能遭受重大损失。为维护投资者利益,本基金将于2026年7月30日开盘起至当日10:30停牌。

澜起科技:首次回购50万股A股股份,回购金额约1.03亿元

澜起科技公告,2026年7月29日,公司通过集中竞价交易方式首次回购A股股份50万股,已回购股份占公司总股本的比例为0.04%,购买的最高价为210.00元/股、最低价为192.18元/股,支付的金额总额约为人民币10276.49万元(不含佣金、过户费等交易费用)。

伊朗谴责美国沙特袭击伊拉克

据CCTV国际时讯,伊朗外交部今天(7月29日)发表声明,强烈谴责美国和沙特对伊拉克部分地区发动袭击。声明称,这些袭击侵犯伊拉克国家主权和领土完整,违反《联合国宪章》和国际法,目的是“服务于美国和以色列政权扩大西亚地区战争和冲突范围的图谋”。声明还称,袭击造成多名伊拉克民众死亡,伊朗对此表示哀悼,并重申对伊拉克政府和人民的支持。声明同时表示,美国及其地区盟友应对“这些罪恶、不人道和挑衅行为”所造成的后果承担责任。

知情人士:霍尔木兹海峡仍然完全封闭

7月29日,据伊朗媒体Fars News,一位军事知情人士表示,霍尔木兹海峡仍然完全封闭,任何船只都没有权利通过这一战略水道。任何试图通过的船只,特别是那些不理会警告的船只,将会面临果断和迅速的反应。

伊媒称美空袭伊朗与伊拉克边境地区

7月29日,据伊朗国家电视台,当地时间7月29日下午,伊朗西阿塞拜疆省皮兰沙赫尔市边境地带遭到美国空袭。

匈牙利议会投票决定取消该国关于加密货币交易验证的要求

7月29日,据The Block报道,匈牙利财政部长安德拉斯·卡尔曼(Andras Karman)表示,匈牙利议会投票决定取消该国关于加密货币交易验证的要求。这项废除措施属于一项更广泛税收方案的一部分,它取消了在进行特定加密货币兑换之前必须验证钱包所有权、资产来源及客户数据的义务。

卡布里贷款与OpenAI展开合作 将企业级AI应用于借贷业务运营

7月29日,卡布里环球资本有限公司旗下卡布里贷款与OpenAI展开合作,将企业级人工智能应用于借贷业务运营。