风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

多模态不是外挂,而是智能的原生起点:一场关于AI未来方向的思想交锋

摘要

我们可能高估了Agent自主化,低估了AI对社会的改变 “走出洞穴”:多模态是“外挂”还是“灵魂”? 当大模型能力逼近物理极限,多模态正从技术延伸走向范式重构。核心问题浮现:AI应以语言为中心,还是以世界为中心?...

多模态不是外挂,而是智能的原生起点:一场关于AI未来方向的思想交锋

我们可能高估了Agent自主化,低估了AI对社会的改变

“走出洞穴”:多模态是“外挂”还是“灵魂”?

当大模型能力逼近物理极限,多模态正从技术延伸走向范式重构。核心问题浮现:AI应以语言为中心,还是以世界为中心? 一种观点认为,大语言模型已是智能核心,多模态只是其能力边界的自然延展;另一种则主张,只有当AI真正感知、交互并建模物理世界时,多模态才成为智能最基础、最原生的组成部分——它不是语言模型的插件,而是新智能的起点。 复旦大学邱锡鹏教授指出,当前模型欠缺的并非更多模态数据,而是真实世界的Context——即对复杂情境的理解能力。未来需要的不是堆叠多模态输入,而是一整套面向现实环境的Harness系统,支撑模型将动态场景转化为可计算表征。 达摩院赵德丽则从智能起源出发,提出通向通用智能的四条路径:大语言模型、开放空间机器人、数字生命模拟、神经信号交互。它们共有的本质是多模态性——人类智能诞生于视觉、听觉、触觉与动作的协同,而非单维语言符号。猎豹捕猎、蚂蚁寻路等行为,皆通过感知-行动闭环习得,无需语言中介。物理世界建模需四维因果:空间、属性、因果链、运动轨迹;而语言模型仅具一维序列性,天然受限。 阶跃星辰张祥雨将焦点转向学习机制。他强调,路线之争(语言vs视觉)实为表象,根本矛盾在于“是否具备后天自主学习能力”。当前模型依赖静态、高密度的语言数据,在模仿学习范式下占优;但面对稀疏、高维、长程的多模态信号,这套范式已显疲态。更关键的是,智能体尚无法从环境反馈中高效自进化——实习生能快速成长,而Codex类模型却长期停滞,症结正在于此。 南洋理工刘子纬以柏拉图“洞穴寓言”作喻:语言是真实世界的低维投影,我们长久困于影子规律之中。要迈向真实,必须走出洞穴——即放弃对文本化石燃料的路径依赖,转向多模态这一新型能源形态。制造业等高价值场景,注定无法脱离视觉、力觉、时序等多维感知,而下一代智能的涌现,也必生于其中。

数据、架构、范式:跃迁真正的瓶颈在哪?

共识正在形成:多模态已过技术验证期,进入深水攻坚阶段。但制约其突破的,究竟是数据不足,还是底层范式失效? 刘子纬直言:数据、架构、训练范式三者均未准备好。语言模型的成功是历史偶然——互联网二十年语料+游戏GPU算力恰好齐备;而多模态数据天然稀缺:家务流程、产线操作、服务交互等长程、带因果、含反馈的真实行为,难以被系统记录与标注。这不仅是技术难题,更是组织与社会层面的系统工程。 架构上,当前主流仍是“语言中心+桥接多模态”,缺乏原生设计:输入如何统一表征?输出如何联合生成?长上下文如何分层管理?稀疏编码在何处嵌入?这些基础问题尚未破题。 学习范式更成瓶颈。张祥雨指出,Transformer的Context本质是工作记忆——无损但短效,无法替代人类分层记忆机制(瞬时感知→短期工作→长期情境/语义)。当百万token图像涌入,模型既无法压缩,亦不能遗忘,导致有效信息湮没。真正的在线学习需解决三大命题:怎么学(算法)、学什么(探索驱动)、学得高效(记忆与计算协同)。 赵德丽补充产业视角:物理世界数据极度匮乏。机器人领域,年数据量仍以十万小时计,远未达GPT级训练门槛。但中国优势在于场景富集——工业产线、家庭服务、智能家电等真实需求密集,数据天然生长于土壤之中,这是不可复制的落地禀赋。 他还强调,算法创新从未退场:PPO/GRPO强化学习框架、Sparse Attention结构优化、DeepSeek的Ingram知识注入机制,每一项都切实推动边界前移。Memory机制的革新,更需软硬协同——既要芯片级支持,也要个人与工作数据的长期可用性设计。

五年预言:高估Agent,低估社会重构

回望2023,AI并未如预期取代岗位,而是重塑协作方式;被低估的,是范式迭代速度——强化学习回归核心、测试时扩展成为新赛道,皆出人意料。 邱锡鹏倾向演化不可预测论:“AI for AI”或成下一跳点——用已有的代码模型、智能体模型反哺自身,迭代出更优多模态范式。ChatGPT的爆发,实为Seq2Seq到Transformer的渐进积累,突变源于长期量变。 赵德丽则给出社会尺度判断:企业级Agent的自主化能力被显著高估;而AI对社会运行逻辑的渗透,被严重低估。以支付为例——现有体系为人设计,而智能体间交易需重构认证、风控、清算全链路。这不是功能升级,而是社会基础设施的重写。 两种视角殊途同归:技术演进未必按图索骥,但社会肌理的改写,已在静默发生。

结语:多模态,已是主战场

语言模型是通往智能的重要阶梯,却非终点。从情境理解、四维因果建模、自主进化,到走出洞穴直面真实——顶尖学者的分歧背后,是高度一致的方向确认:多模态正从辅助工具升维为智能基座。 算法仍在狂奔:Memory机制重定义、强化学习深度整合、世界模型构建、在线学习范式突破……每一步都指向物理世界的智能扎根。 而中国在具身场景的广度与深度,正成为全球竞争的关键变量。五年之后,我们或将发现:AI最深远的影响,不在于它多像人,而在于它如何悄然重编社会的运行协议。

评论 (6)

登录 后即可发表评论
浮生过客

顶尖学者虽有分歧,但多模态方向一致,算法发展肯定会让AI扎根物理世界。

0 回复
地主家的傻儿子

多模态从辅助变智能基座是大趋势,中国场景优势在全球竞争里应该能发挥作用。

0 回复
詹先森
詹先森 1周前

多模态是新智能起点这观点挺新颖,现在模型确实缺对现实场景理解能力,得搞面向现实的系统。

0 回复
爆米花
爆米花 1周前

说企业级Agent自主化被高估,AI对社会影响被低估,确实支付那块就得重写基础设施。

0 回复
不高兴
不高兴 1周前

感觉制约多模态突破的问题还挺多,数据、架构、范式都没准备好,这攻坚难度不小。

0 回复
更多