研究实锤:世界模型根本不懂物理定律,属于它的“ChatGPT时刻”还很远

3 次阅读 2026年07月29日

近年来,基于视频生成模型的世界模型(World Models)已成为人工智能领域备受关注的方向之一。Sora、Genie、Cosmos、V-JEPA 这些视频生成模型,都指向了一个共同的假设:如果它们看过足够多的视频,或许就会逐步形成“物理直觉”,进而理解物理世界。

然而,问题在于,现有基准很难验证这一假设是否成立。

视频生成模型究竟是遵循了物理定律,还只是生成了看起来正确的结果?它能否像牛顿一样用物理定律思考,而不只是像亚里士多德那样依赖“直觉”?

针对这些问题,南洋理工大学 S-Lab 团队及其合作者提出了首个以物理定律为核心的视频模型评估基准 Apple-π。结果表明,当前的视频生成模型距离可靠的通用世界模拟器仍有很大差距,即使是SOTA 模型的得分也只有 0.473

论文链接:https://arxiv.org/abs/2607.16401

研究团队表示,即使现有模型能根据标注好的第一帧画面生成看起来合理的运动,也不代表它们真的看懂了物体关系、学会了物理规律,或能始终按一致的运动规律生成结果。

这项工作旨在帮助未来的视频生成模型真正学会依照物理定律理解和模拟世界,但属于世界模型的“ChatGPT时刻”依然很远,而要做到这一点,研究人员还需要为视频世界模型赋予更强的场景理解能力、更丰富的物理推理数据,以及专门面向推理的后训练。

Apple-π,锚定在物理定律中的基准

Apple-π 是首个以物理定律为核心的视频模型评估基准它要求模型感知相关物理量、表述支配定律,推导出符合定律的后续运动,并定位推理失败发生在哪一步。

图|Apple-π 概览。

具体设计如下:

1.视频数据集:Orchard 包含 400 个经典力学视频,先确定物理定律和初始条件,再生成或筛选对应视频。任务分为单一定律和多定律组合两类,覆盖重力、碰撞、惯性及多段运动衔接,考察模型能否持续更新位置和速度。

图|Orchard 概览。

2.基准协议:Apple-π 将 Orchard 案例拆为感知、表述和推导三类任务,五个子轨道,用于分项评估模型的物理推理能力。感知-文本用于复刻画面中的数字和标注,感知-图形用于定位并保留实验物体;表述-文本从候选物理公式中选择支配方程并代入变量,表述-图形预测目标时刻的物体位置并标注速度;推导则基于首帧初始条件生成完整运动视频。

图|Apple-π 基准协议。

3.评估套件:Apple-π 采用混合评分机制。多模态大模型评分用于评估回答合理性、格式合规性和画面清晰度;在具备物体掩码和轨迹真值的赛道中,物理真值指标用于量化物体定位、轨迹和速度误差,判断运动过程是否符合物理规律。各赛道得分统一归一化到 [0,1]。

无论哪类模型,物理推导表现都有限

研究团队在完整 Apple-π 基准上评估了 11 个代表性模型。整体结果显示,视频预训练、推理监督和统一理解均能改善模型的感知和表述能力;不过无论哪类模型,物理推导表现都十分有限。

具体来看,专有模型结果整体强于基础开源视频模型,大规模、高质量视频训练可以蒸馏有用的物理先验;经过视频推理微调的 VBVR-Wan2.2,也在视频模型中表现更有竞争力;GPT Image 2 和 Nano Banana 2 结果显著领先说明显式理解和可控视觉生成有助于标注读取、物体 grounding 和最终帧生成。

即使是SOTA 模型的得分也只有 0.473,物理运动推理仍然是目前的主要瓶颈。

图|主要结果。

此外,为了进一步定位模型在不同推理环节中的问题,Apple-π 将评测流程拆分为感知、定律建模和动态推演三个阶段,考察模型在感知、对齐、推理和生成上的能力。

结果显示,模型的错误并不只出现在最终生成阶段,还体现在中段的物理推理环节:即使部分模型能完成标注读取和物体定位,其在物理规则选择、状态更新以及后续运动预测上仍明显不足。它们更多依赖表层视觉模式匹配,尚未形成稳定的物理状态建模能力。

局限性

尽管 Apple-π 能更细致地评估视频模型的物理推理能力,但仍存在一些不足。

例如,Apple-π 覆盖的范围仍然有限。它主要聚焦经典刚体力学,包括重力驱动运动、动量守恒碰撞、牛顿第一定律,以及这些规律的简单组合,但并未评估流体、热力学、电磁学、断裂、颗粒介质、生物运动或量子现象。

同时,Apple-π 覆盖的物体和场景也不全面。数据中的动态物体只包括球体、立方体、圆柱体和圆锥体。由于使用单一固定相机,因此它并不直接考察多视角一致性或新视角生成能力。

研究团队指出,Apple-π 的输入设置依然依赖第一帧标注来固定场景与物理量的对应关系。因此,基准主要考察模型在已有视觉场景下的物理推理能力,不测试模型能否仅凭文本构造完整物理场景。

此外,当前的评估方式也存在不足。MLLM 裁判无法完全判断物理过程是否正确,因此 Apple-π 还需要结合掩码、像素和速度等指标,这些指标也会受到分割质量、画面差异和标注噪声的影响。

最后,Apple-π 在时间归一化上也有局限。评估默认将完整解码后的输出视为提示词要求的物理时长,但视频生成服务可能返回不随请求时长变化的固定长度视频容器,评估结果会因此受到影响2。

本文来自微信公众号“学术头条”(ID:SciTouTiao),作者:夏千斯,36氪经授权发布。

(5)

超级棒棒糖

评估方式有不足,受分割质量等影响,时间归一化也有局限,得完善。

0
用户094016
用户094016 2小时前

这研究说明现在世界模型离真正懂物理还远着呢,Apple - π有作用但也有局限,还得接着改进。

0
梦想快乐
梦想快乐 2小时前

现有模型物理推导不行,Apple - π覆盖范围有限,后续研究得扩大范围啊。

0
清风_2
清风_2 3小时前

Apple - π能评估物理推理,但输入依赖标注,还不能测试文本构造场景能力。

0
G影随行
G影随行 3小时前

模型更多靠视觉匹配,没稳定物理建模能力,离‘ChatGPT时刻’远着呢。

0

新东方第四季度净营收15.3亿美元,预估14.7亿美元;第四季度经营利润8,580万美元,预估7,550万美元。

新东方第四季度净营收15.3亿美元,预估14.7亿美元;第四季度经营利润8,580万美元,预估7,550万美元。

韩国三家造船厂第二季度营业利润突破2.7万亿韩元 得益于高附加值LNG运输船

今年二季度,韩国三大国内造船厂业绩强劲,综合营业利润超过2.7万亿韩元,主要得益于液化天然气(LNG)运输船等高附加值船舶比例的增加。据业内消息,29日,HD韩国造船海上工程[009540]、韩华海洋[042660]和三星重工业[010140]在第二季度实现了2.7062万亿韩元的合计营业利润。总销售额为17.609万亿韩元。造船热潮期间订购的高价船舶现已反映在销售中,生产力提升和选择性订单策略被认为提升了盈利能力。

纳指科技ETF景顺(159509)将于2026年7月30日开市起停牌,自2026年7月30日10:30起复牌,停牌期间赎回业务照常办理。

纳指科技ETF景顺(159509)将于2026年7月30日开市起停牌,自2026年7月30日10:30起复牌,停牌期间赎回业务照常办理。

美光科技、闪迪、SK海力士等存储股盘前全线转涨

7月29日,美股盘前,美光科技、闪迪、SK海力士等存储股全线转涨,此前跌3-4%不等。希捷科技、西部数据分别上涨4.6%、2.2%。

贝莱德盘前续涨约2% 联手Meta,加码AI基建

7月29日,全球资产管理巨头贝莱德(BLK.US)美股盘前续涨约2%。消息面上,据彭博消息,科技巨头Meta近日与贝莱德联合宣布,双方达成合作设立合资企业,共同开发运营坐落于美国得克萨斯州埃尔帕索的大型AI数据中心园区,项目整体开发投入规模达140亿美元,将为人工智能算力基础设施建设提供强力支撑。此次合作让贝莱德深度参与AI基础设施投资,契合当前市场热点,直接提振了投资者情绪。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月23日从11.00%降至10.48%,卖出的平均股价为34.4085港元。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月23日从11.00%降至10.48%,卖出的平均股价为34.4085港元。

美股盘前,美光科技、闪迪、SK海力士等存储股全线转涨,此前跌3-4%不等。

美股盘前,美光科技、闪迪、SK海力士等存储股全线转涨,此前跌3-4%不等。

香港交易所信息显示,德意志银行在哔哩哔哩-WH股的持股比例于07月24日从18.18%升至19.04%。

香港交易所信息显示,德意志银行在哔哩哔哩-WH股的持股比例于07月24日从18.18%升至19.04%。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月24日从10.48%升至11.44%,购买的平均股价为33.2783港元。

香港交易所信息显示,摩根大通在天齐锂业H股的持股比例于07月24日从10.48%升至11.44%,购买的平均股价为33.2783港元。

阿达尼企业第一季度亏损116亿卢比,去年同期盈利88.5亿卢比。

阿达尼企业第一季度亏损116亿卢比,去年同期盈利88.5亿卢比。