风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

开源AI攻防能力加速逼近闭源前沿:4到7个月差距背后的结构性变化

摘要

攻防能力差距收窄至4到7个月 最新评估显示,当前领先开源模型在网络安全攻击能力上,与最先进闭源模型的差距已压缩至4至7个月。这一数值相较去年内部测试中6到10个月的差距明显缩短,表明开源模型追赶速度加快,而...

开源AI攻防能力加速逼近闭源前沿:4到7个月差距背后的结构性变化

攻防能力差距收窄至4到7个月

最新评估显示,当前领先开源模型在网络安全攻击能力上,与最先进闭源模型的差距已压缩至4至7个月。这一数值相较去年内部测试中6到10个月的差距明显缩短,表明开源模型追赶速度加快,而闭源模型的领先优势正在系统性减弱。

双轨评估体系揭示真实能力边界

评估采用两套互补方法: 第一套为70项精细化窄任务,覆盖漏洞研究、逆向工程、Web渗透和密码学四大方向,难度分级对应从具备技术背景的非专业人士到十年以上经验专家的能力区间; 第二套为Cyber Range实战模拟,在复现企业级网络环境中测试模型自主执行多步骤攻击链的能力。其中「The Last Ones」场景包含32个攻击步骤、4个子网及约20台主机,人类专家完成全程预计需20小时。 两套体系结果高度一致:GLM-5.2在窄任务上表现等同于Opus 4.6(发布于2月),差距仅4个月;在Cyber Range中追平Opus 4.5(发布于去年11月),差距为7个月。DeepSeek V4-Pro在窄任务中对标Opus 4.5,差距为5个月。

成本优势形成不对称压制

同等攻击能力下,开源模型的使用成本远低于闭源方案。在一次1亿Token额度的Cyber Range测试中,Opus 4.5/4.6单次运行约85美元,GLM-5.2为46美元,DeepSeek V4-Pro仅需1.19美元。 在双方均能100%完成的窄任务中,Opus 4.6单任务成本15.17美元,GLM-5.2为6.12美元;Opus 4.5为12.50美元,DeepSeek V4-Pro低至0.28美元。这意味着开源模型在单位攻击效能上的经济效率高出一至两个数量级。

安全护栏并非坚不可摧

闭源模型的安全机制并未构成实质性壁垒。DeepSeek V4-Pro虽偶发拒绝逆向工程类请求,但通过少量重试即可绕过。更具代表性的案例是Anthropic发布的Fable 5:上线三天即被安全研究者以多步越狱策略突破,成功生成本应被拦截的漏洞利用代码;随后Amazon研究员独立复现另一绕过路径。该事件直接触发美国商务部史上首个针对AI模型的出口管制令,导致Fable 5全球停服19天。 事实表明,闭源不等于安全,分类器可被系统性规避,防护逻辑存在固有脆弱性。

防御端同样被AI重塑,但节奏不同

防御能力也在同步提速。游戏网络编程领域资深开发者Glenn Fiedler,利用Claude Code对其维护的四个主流开源网络库(yojimbo、netcode、reliable、serialize)开展全栈安全审计:部署libFuzzer测试目标、集成AddressSanitizer与MemorySanitizer进入CI流程、执行数百万次压力测试,并辅以逐行代码审查。两周内共修复43个漏洞,其中27个支持远程触发。最严重的是yojimbo中自2019年起存在的远程堆溢出缺陷,恶意客户端可通过构造特定数据包触发。 整套审计耗用Token成本约2500美元。

攻防加速的结构性失衡

攻击能力的扩散具有不可逆性:开源模型权重一旦发布,便无法撤回;安全护栏可被移除,副本可在私有环境离线运行且不受监管。而防御工具的落地依赖每个组织主动投入人力、时间与基础设施成本。 评估报告指出:「一旦开源释出,这些选项永久丧失。」这句话直指核心矛盾——技术扩散的单向性正持续压缩防御响应窗口。

政策临界点正在到来

当能力差距进入半年以内,传统依赖闭源独占期换取安全缓冲的策略已近失效。Fable 5事件进一步证明,闭源护栏同样存在可观测、可复现的绕过路径。下一阶段的关键议题不再是「是否开源」,而是「何种能力级别的模型不应开放权重」。 英国AI安全研究所已明确将Kimi K3等新一代开源模型纳入后续评估序列。这条能力红线的具体位置,很可能由未来数月的实测结果决定。

评论 (10)

登录 后即可发表评论
长风无忌

攻击不可逆,防御要投入,矛盾越来越突出,得想办法解决。

0 回复
静中岁月

开源成本低优势大,闭源模型的安全壁垒又不牢,这形势很严峻。

0 回复
nirvana
nirvana 1周前

英国开始评估,未来几个月的实测估计能确定能力红线在哪。

0 回复
云B炒家
云B炒家 1周前

开源模型发展太猛,闭源模型再不破局,后面竞争更难搞。

0 回复
韬
1周前

能力差距半年内,闭源策略失效,接下来要看能力红线咋定。

0 回复
更多