当大语言模型竞赛进入资本深水区
大模型能力的跃迁正迅速演变为一场超级资本密集型的军备竞赛。算力、数据、人才的投入不断刷新纪录,但越来越多从业者开始追问:在语言模型之后,AI真正的突破点在哪里?答案正在从“屏幕之内”转向“屏幕之外”——走向可感知、可交互、可作用于真实物理世界的智能。
物理AI:不是延伸,而是范式迁移
它不再满足于理解与生成文本、图像或视频,而是要建立与现实世界持续互动的能力。这种转变意味着学习方式的根本重构:从离线训练转向在线学习,从静态推理转向动态反馈,从单向输出转向闭环行动。交互不再是目的,而成为驱动能力持续进化的数据飞轮。
空间智能、具身通用与世界模型的三重锚点
群核科技将落点锚定在“空间智能”,目标是让大模型生成一个可交互的三维世界——不是渲染画面,而是建模重力、摩擦、结构约束等底层物理规律;生数科技聚焦“物理世界的通用模型”,相信物理世界终将迎来自己的Scaling Law与ChatGPT时刻,其技术路径强调多模态融合与动作-状态联合建模;银河通用则提出世界模型必须具备三项不可分割的能力:准确建模动作对环境状态的改变、以状态建模反哺策略学习、具备跨场景通用的评价能力。
分歧不在方向,而在抵达路径
关于如何构建世界模型,业界存在两条主线:一派主张回归物理仿真,认为视觉只是表象,世界由不可见的力学规律驱动;另一派相信纯视频数据+足够规模的模型,终将涌现对物理世界的隐式理解。但共识正在形成——单一路径难以突破瓶颈,真正可行的方向,是融合结构化物理先验、多源传感数据与端到端学习能力的混合架构。
落地逻辑已悄然改变
与数字AI追求通用性不同,物理AI的突破口在于“有限范围内的全面通用”。一辆车无需理解宇宙,只要在道路场景中可靠决策;一个工厂机器人无需掌握所有技能,只需在产线空间内完成高精度协同作业。这种“小世界、大能力”的思路,大幅降低了工程门槛与验证周期。数据采集的挑战依然突出,但核心矛盾已从“有没有数据”,转向“如何低成本、规模化地把物理世界的维度——尺寸、质量、材质、力反馈、时序因果——系统性地数字化”。
模型与系统的边界正在消融
当前物理AI系统中,“模型”与“Harness”(任务规划、执行监督、反馈闭环)仍呈双轨并行。但长期趋势明确:二者将逐步融合为“One Model One System”。一个物理AI模型,未来将不仅输出指令,更能自主感知、实时评估、动态纠错、持续进化——它本身就是一个最小功能完备体,可直接部署为产品、产线模块甚至服务单元。数字智能的能力,将成为物理AI系统的子集,而非平行赛道。
(8)
物理AI学习方式重构,交互成进化数据飞轮,想法挺新颖。
构建世界模型有分歧,不过混合架构感觉是可行方向。
业界对世界模型构建路径有分歧,得融合不同方法才行。
物理AI厉害啊,要建立和现实世界互动能力,改变学习方式。
落地逻辑变了,不追求大而全,小世界大能力挺务实,降低了门槛。
感觉AI发展方向变了,从屏幕到现实世界,落地思路也不同了,这转变挺大。
物理AI由屏幕内走向外,交互学习方式都变了,未来发展值得关注。
模型和系统边界在消融,未来物理AI会很强大,数字智能成子集。