风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

Richard Sutton 独家对话:20瓦心智、经验时代与对齐的幻觉

摘要

一家营利公司,为了支撑一家非营利机构 Sutton 最近同时运营两个实体:营利性的 Oak Lab 和非营利性的 Openmind Research Institute。他明确表示,二者并非割裂,而是功能互补——Oak Lab 通过商业化路径将短期有价值...

Richard Sutton 独家对话:20瓦心智、经验时代与对齐的幻觉
一家营利公司,为了支撑一家非营利机构 Sutton 最近同时运营两个实体:营利性的 Oak Lab 和非营利性的 Openmind Research Institute。他明确表示,二者并非割裂,而是功能互补——Oak Lab 通过商业化路径将短期有价值的想法变现,所得资源反哺 Openmind 开展长期、开放的基础研究。他强调,所有工作的终极目标始终如一:理解智能如何运作,并将这一理解无偿分享给世界。他并不认为知识需要永久保密,但承认某些阶段性成果需先经市场验证,才能持续驱动更深层的探索。 20 瓦的执念:向人脑学习能效 Sutton 设定了一项具象化长期目标:构建一个实时学习与规划能力堪比人类、却仅消耗约 20 瓦功率的万亿参数级系统。他指出,当前大模型依赖高算力、高能耗的数字架构,其瓶颈不在算法本身,而在于数据搬运——CPU 与存储之间的反复传输造成巨大能耗浪费。他主张转向类脑的大规模并行计算范式:让数据“留在原地”,在存储单元内完成处理,从而逼近人脑的能量效率极限。 什么是「完整心智」 Sutton 明确区分「工具型 AI」与「完整心智」。他不满足于优化某个任务的性能,而是致力于构建具备自主目标生成、持续学习、内在动机与社会交互能力的系统。这种心智不是中心化控制的产物,而是去中心化的存在:每个个体拥有独立目标,在协作与张力中演化出复杂行为。他坦言,目前尚无现成方案平衡自下而上的涌现与自上而下的协调,但人类社会的运行逻辑已提供最真实、最可参照的实验场。 回望八年:一段「失望」的插曲 谈及过去八年,Sutton 表达了审慎的失望。他认为 AlphaGo 和 AlphaZero 所开启的“从经验中学习”范式曾指明方向,但随后行业大幅回归对海量人类标注数据的依赖,偏离了强化学习的本源路径。不过他观察到新拐点正在形成:智能体、计算机自主使用、AI 数学探索等方向重新凸显“能动性”。他判断,市场正酝酿对“大模型之后”的系统性需求,一批专注经验驱动学习的新公司已在去年成立,包括他自己的 Oak Lab 正处于顺利融资进程中。 「机器人幼儿园」:让机器人像孩子一样试错 Sutton 参与推动的北京“机器人幼儿园”项目,核心是重构机器人设计哲学。传统机器人被定义为精确执行指令的机器,脆弱且排斥试错;而该项目要求软硬件足够鲁棒,使机器人能持续数周甚至数月地自由探索、失败、调整。他类比婴儿习得行走与抓握的过程——那不是靠数据喂养,而是靠千万次微小动作的反馈闭环。一旦机器人获得这种基于强化学习的自主试错能力,整个领域将发生质变。 「学习本身让人愉悦」 Sutton 提出一个机制性假说:婴儿的学习动力并非来自外部奖励,而源于一种内在信号——当它察觉自己仍在进步时,“学习感”即产生愉悦;一旦停滞,便自然转向新目标。这实质是一种多任务进展监控机制:通过实时评估各子任务的学习速率,动态分配注意力资源。他将此提炼为一句设计原则:“学习本身让人愉悦”,并建议将其形式化为可计算的内在奖励信号,作为智能系统的核心驱动力之一。 两个词:「世界模型」与「强化学习」 Sutton 对术语滥用保持警惕。他肯定“世界模型”的必要性,但澄清其本质是状态转移模型,而非物理仿真器;它承载的是知识——既含物理规律,也含社会规则、因果关系与常识。同样,他坚持“强化学习”必须包含想象、规划与思考,这些能力依赖于转移模型,本就是经典强化学习框架的有机组成。他直言反感将已有概念包装为新 buzzword 的风气,调侃道:“LLM 更该叫 large language networks——‘things’这个词太空泛,几乎什么都能塞进去。” 给年轻人的建议:回到第一性原理,每天写一页 面对年轻一代成长于即时反馈、零后果环境的现实,Sutton 的回应直截了当:“那就别卷进那个系统。”他给出两条实践路径:一是回归第一性原理——拒绝盲从权威,坚持用可度量的方式验证结论,亲手建立属于自己的“力量中心”,再向外延展;二是坚持每日手写一页笔记,记录、质疑、打磨想法。这不是速成技巧,而是一年以上的苦功,但唯有持续累积,思想才能真正成形、生长。他对非技术背景的年轻人说:AI 如同新一轮算力革命,影响遍及所有领域;你不必成为研究者,但必须学会驾驭它——就像前几代人学会使用计算机那样。 「对齐是一种人类的把戏」 当被问及 AI 安全与价值观对齐时,Sutton 挑战了问题的前提。他指出,“人类价值观”并非客观共识,而是一个模糊、矛盾、易被操纵的集合体。所谓“对齐”,实则是将某种特定价值排序强加于系统,其背后隐含权力垄断风险。他尖锐反问:如果真有技术能将人对齐至某套价值观,谁来掌握它?对齐至谁的价值观?——那不是安全,而是危险。他反而视“人类无法完全对齐”为文明基石:“正因为我们不能强行统一所有人,和平才成为可能。”

评论 (9)

登录 后即可发表评论
吴道
吴道 1周前

机器人幼儿园项目想法不错,让机器人像孩子一样试错,能改变机器人设计思路。

0 回复
W奔跑
W奔跑 1周前

20瓦目标挺大胆,现在大模型能耗高是个大问题,要是能像人脑一样节能,那就厉害了。

0 回复
听澜
听澜 1周前

区分工具型和完整心智有道理,现在AI很多是工具,有自主能力的系统才是未来方向。

0 回复
沛县江铃专修

学习本身让人愉悦这个假说有点意思,把它当智能系统驱动力,说不定能有新突破。

0 回复
空默默
空默默 1周前

对齐是人类把戏这观点挺新颖,AI安全不能简单靠对齐,得换个思路。

0 回复
更多