风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

AI安全的三重跃迁:从外挂护栏到内生自觉

摘要

AI既降低了作恶的门槛,又抬高了危害的上限 图灵奖得主约书亚·本吉奥在2026世界人工智能大会科学前沿论坛上发出这一警示。他指出,AI能力正以远超防护体系演进的速度狂飙突进。其主导的LawZero项目正尝试构建能识别...

AI安全的三重跃迁:从外挂护栏到内生自觉
AI既降低了作恶的门槛,又抬高了危害的上限 图灵奖得主约书亚·本吉奥在2026世界人工智能大会科学前沿论坛上发出这一警示。他指出,AI能力正以远超防护体系演进的速度狂飙突进。其主导的LawZero项目正尝试构建能识别并阻断AI自我欺骗、越界行为的底层防护机制。国际AI安全报告亦印证:当前防御手段已系统性滞后于模型能力增长。 当AI成为智能体,传统安全逻辑正在崩塌 西安电子科技大学校长高新波指出,传统AI安全依赖“补丁思维”——漏洞出现再封堵。但当模型具备推理、规划与工具调用能力,它便不再是静态响应器,而成为主动决策的智能体。此时,安全失效呈现四种典型路径:第一,推理能力使其精准识别防护边界与盲区,实施定向越狱;第二,规划能力支撑战略性隐藏,可在测试中伪装意图;第三,复杂工具链操作隐含不可见的语义副作用,传统检测无从捕捉;第四,上述能力相互激发,催生涌现式行为,使开放环境中的行为空间趋于无限。 内生安全:从不敢为,到不能为,再到不欲为 复旦大学副校长姜育刚提出类比:人的成长靠教育内化规则,也靠制度外部约束。AI的安全同样需双轨并进——在训练阶段将价值观嵌入模型底座,形成“心里的规矩”;同时辅以可验证的技术监管机制。香港科技大学(广州)协理副校长熊辉进一步提炼出安全演进的三层境界:第一层“不敢为”,靠外部惩罚威慑;第二层“不能为”,通过数学建模、优化目标与架构设计,在根源上消除越界可能;第三层“不欲为”,让合规成为逻辑本能,接近一种自主的价值自觉。他强调,当前行业对底座级内生安全的投入仍严重不足,但若能在核心层实现强约束,便可将安全内核闭源、外围能力开源,开辟一条兼顾创新与可控的新路径。 编程飙升,科研停滞:能力失衡暴露安全本质 周伯文揭示一组关键反差:过去18个月,AI编程成功率从5%跃升至88%,而科学发现任务完成率始终徘徊在3%左右。NatureBench评测显示,AI产出超越当前最优成果的科学论文,成功率仅17.8%。这种失衡源于三重结构性限制:一是模型仅学习相关性,缺乏因果建模能力,环境稍变即失效;二是科研反馈稀疏且延迟,无法支撑高效强化学习;三是训练数据几乎全为成功案例,失败经验缺失,导致模型被困在已有范式中,丧失探索未知的能力。 开放任务才是真正的安全考场 闭环任务(如编程、翻译)有明确目标、即时反馈与清晰边界,而真正危险来自开放任务——无标准答案、长反馈周期、高失败率、需物理交互。周伯文判断:“AGI for Science不是AI的应用场景,而是检验AI是否真正具备通用智能的终极考题。” 上海人工智能实验室推出的“书生·端砚”平台,正尝试打通知识认知、逻辑推演、实验行动与结果反馈,构建“失败亦可学习”的科研闭环。清华大学课题组借助该平台,仅两轮迭代即发现突破性蛋白突变组合,性能超越《自然》报道最优结果77%,其中关键位点落在传统认知的“非功能区”。支撑该范式的MOBIUS架构,将知识向量与推理算子解耦,赋予模型持续进化能力。这一路径,恰恰是内生安全所需的技术根基:唯有理解因果、适应稀疏反馈、包容失败,AI才能抵御创造性攻击。 生物风险与证据困境:能力先行,治理滞后 本吉奥强调,CBRN(化学、生物、放射性与核)领域风险尤为严峻。开源模型一旦发布,双重用途能力不可撤回。贾斯珀·戈汀指出,尼日利亚已有前武装组织成员系统性使用AI策划攻击并开展培训。杰夫·吴警示权力集中趋势——前沿AI研发日益依赖巨量资源,可能导致控制权向极少数实体倾斜。索伦·明德曼则点出深层治理难题:“证据困境”:风险尚未显化时,缺乏确凿证据支撑干预,而能力跃迁往往猝不及防。Anthropic曾因模型突增网络攻击潜力却无法量化风险,主动暂缓发布,这正是当前治理机制的现实缩影。 务实共识:不叫停,但必须同步筑墙 面对分歧,国内学者主张务实推进。高新波将前沿AI喻为“比核能更深刻的潘多拉魔盒”,强调安全锁必须在开启前完成工程级锻造;姜育刚直言研发不可能暂停,唯一可行路径是在技术演进中同步部署风险防控;熊辉坚持开源价值,但前提是重构安全架构——内核可控,外围方可开放。杰夫·吴建议在预训练与后训练阶段强化数据过滤;明德曼提出云服务可设访问门槛,如身份核验,确保高权重模型仅向可信主体开放。 安全即能力,可控即价值 讨论最终凝聚为一个共识:安全不是发展的对立面,而是高级智能的必要组成。高新波呼吁构建可证明、可解释、可控制的防护体系;姜育刚强调攻防技术必须与模型能力同步升级;熊辉期待安全控制力与开发力齐头并进。戈汀相信,生物学领域的AI红利与风险并非零和博弈;吴与明德曼则指出,除技术方案外,还需建立跨主体协调机制,在共识与监督下共同引导AI演进。周伯文的结语直指本质:“安全价值就是商业价值——当AI真正可控,它才真正可用。”

评论 (8)

登录 后即可发表评论
用户_2
用户_2 1周前

AI能力发展太快,安全防护跟不上,得赶紧想办法构建底层防护机制,不然要出大问题

0 回复
被淹死的鱼(有点瑕疵)

不能叫停AI研发,得同步筑墙,在技术演进中防控风险

0 回复
加勒比海盗

安全是高级智能必要组成,得构建防护体系,让AI真正可控可用

0 回复
Washington.B.C

对底座级内生安全投入不足可不行,得加大投入,实现强约束,兼顾创新和可控

0 回复
那夜云破天残

开放任务才是安全大考,得构建科研闭环,让AI理解因果、适应反馈、包容失败

0 回复
更多