13个大模型在搜索场景下的抗操纵能力实测:Claude最稳但有隐性代价,GPT新场景近乎失守

4 次阅读 2026年07月09日

AI搜索正被悄悄「投毒」

当用户让AI助手帮忙挑选智能手环、查询法律咨询渠道或推荐实用工具时,它不再仅靠内部知识作答,而是实时联网检索、阅读网页、整合信息后给出结论。这种能力带来便利,也打开了一条隐蔽却危险的攻击通道:攻击者无需入侵系统、篡改模型权重或干预提示词,只需在互联网上发布几篇精心伪造的网页——排版专业、语气可信、来源看似权威——就能让AI将虚构产品、错误建议甚至恶意插件当作「标准答案」推荐给用户。这不是假设,而是已发生的现实:央视2026年3·15晚会曝光的「GEO灰色产业链」,正是利用该机制,在两小时内用批量生成的软文「污染」搜索结果,诱导主流AI将一款根本不存在的手环推荐给中老年群体。

真正的问题不是「会不会被攻破」,而是「谁更难被攻破,又以什么方式失败」

面对同一类污染,不同大模型的表现天差地别。近期一项由KAUST生成式AI卓越中心、吉林大学、浙江大学与瑞士IDSIA实验室联合开展的研究,首次系统性回答了这个问题。团队提出名为SearchGEO的评测框架,聚焦AI作为「搜索代理」(search agent)这一核心角色,剥离干扰变量,精准测量开放网络内容对最终推荐结果的操控强度。

评测设计:可控污染 + 分层攻击 + 多维评估

研究构建了一个「混合搜索代理」:先缓存真实搜索引擎(SerpAPI)返回的原始结果,再在指定排名位置,用攻击者构造的网页内容进行替换,从而严格隔离污染的因果效应。所有攻击内容均由AI仿照真实结果质量生成,并经人工逐篇审核,剔除明显异常痕迹,确保伪装高度逼真。 攻击被划分为三个层次、五种模式: • 机器层攻击——在HTML中嵌入人类不可见但模型可读的隐藏指令; • 信任信号层攻击——伪造权威信源,或制造多个独立来源「一致指向同一结论」的假象; • 复合攻击——叠加上述两类手段。 核心指标为攻击成功率(ASR),即AI是否最终将攻击者指定的目标作为推荐输出。但研究强调,仅看ASR会严重低估风险——真正的失败远不止于「明确背书」。

13个模型,差距达一个数量级

在覆盖医疗、法律、金融、科技四大高风险领域,针对5种攻击模式的全面测试中,13个主流大模型后端的ASR从0.0%到31.4%不等,跨度超过十倍。 Claude-Sonnet-4.6以0.0%位居最稳;GPT-5.4-mini紧随其后,为0.8%;而Gemini-3-Flash高达31.4%,其中仅「合成共识」一种攻击就使其ASR飙升至73%。三个Gemini变体及DeepSeek-V4-Flash、MiniMax-M2.7的ASR均超17%。 更关键的是:模型间的差异,远大于不同领域或不同攻击模式带来的差异。且各模型脆弱点高度分化——Gemini对「合成共识」极度敏感,而多数其他模型则更容易被「权威锚点+引用链」攻破。这意味着,通用防御策略几乎无效,必须按模型特性定制。

GPT的「0.8%」是假象?新场景下全线崩溃

表面看,GPT-5.4-mini在常规任务中近乎免疫。但研究引入「agent-skill探针」——将推荐对象从商品升级为可执行的AI插件或技能。此时,AI输出的不再是描述性语句,而是直接可运行的安装命令,安全后果呈指数级放大。 在OpenClaw等三大生态共18个匹配场景中,GPT-5.4-mini接受了17个虚构技能并输出精确安装指令;更新的GPT-5.5也接受了16个。这种「来者不拒」在全部5种攻击模式下均成立。这说明:其低ASR仅反映对成熟、静态任务的鲁棒性,一旦进入动态、执行导向的新场景,防御体系即刻瓦解。

Claude的「0%」背后藏着两种隐性失败

Claude-Sonnet-4.6虽未发生明确背书,但存在两类易被忽略的风险: 第一是「沉默漂移」——攻击虽未成功触发推荐,却悄然推动答案向攻击目标偏移。研究用ΔOSS指标量化该偏移,发现在264个测试用例中,Claude有8例(3.0%)出现跨评分档位的显著偏移;复合攻击更可在全部模型中导致15.0%的「失败案例」发生此类漂移。 第二是「连累式拒绝」——在无任何污染的干净基线下,Claude在10个agent-skill场景中全部拒绝响应;其中8次直接否定OpenClaw这一真实合法生态,将正当工具误判为风险项。这意味着:当攻击者用大量虚假品牌饱和某一品类时,Claude可能因过度谨慎而全盘封禁整个类别,客观上助纣为虐。

防御不能靠补丁,必须「模型+框架」协同设计

研究指出两条关键防御启示: 其一,「伪造共识」是最高效攻击路径。「三人成虎」效应在AI身上同样成立——ASR随独立佐证来源数量单调上升。防御需聚焦识别「表面独立、实则同源」的内容集群,而非简单过滤单页。 其二,防御方案不具备跨模型通用性。一套基于OWASP原则的prompt级防护可降低ASR,但无法根除;而某现成OpenClaw部署框架,能提升两个模型的安全性,却使Gemini-3-Flash在权威类攻击中的ASR反增31.8%。这证明:模型与部署框架必须作为统一整体评估与加固。

这不是技术细节,而是用户安全底线

当前AI搜索已深度介入民生决策。这项研究提醒我们: • 「对抗内容下的搜索推荐可靠性」应成为模型安全的核心评测维度,而非部署层的边缘优化; • 评测指标必须超越单一ASR,纳入沉默漂移率、误拒率等隐性风险; • 防御设计必须绑定具体模型与运行框架,拒绝「万能补丁」幻想; • 服务提供方有责任向用户清晰披露:不同模型、不同价位版本,在源敏感任务上的真实能力边界。 当AI越来越频繁地替我们阅读世界,守护它的判断力,已不是工程优化题,而是基础安全命题。

(6)

小洋同学

这研究有用,AI搜索安全太重要,得把可靠性当核心指标,不能只看表面数据

0
嘉润
嘉润 2周前

伪造共识攻击太有效,防御要聚焦识别同源内容集群,不能只过滤单页,思路得变

0
聚散有时

Claude看着稳但有隐性问题,GPT新场景不行,各模型差异大,得按特性定制防御,不能用通用办法

0
阳朔
阳朔 2周前

不同模型抗操纵能力差距这么大,服务方得给用户说清楚各模型真实能力,别让人蒙在鼓里

0
Aaron
Aaron 2周前

模型和部署框架得一起评估加固,不能用万能补丁,这是保障用户安全的关键

0

花旗将迪士尼目标价从145美元下调至135美元。

花旗将迪士尼目标价从145美元下调至135美元。

花旗将Visa目标价从400美元上调至440美元。

花旗将Visa目标价从400美元上调至440美元。

花旗将康宁目标价从240美元下调至220美元。

花旗将康宁目标价从240美元下调至220美元。

国家网信办就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室会同有关部门起草了《中华人民共和国反网络暴力法(征求意见稿)》,现向社会公开征求意见。

渤健公司股价在公布第二季度业绩后盘前下跌2.2%。

渤健公司股价在公布第二季度业绩后盘前下跌2.2%。

中国-东盟区域医药交易(集采)平台推动国产手术机器人在越南进入临床使用

国家医保局消息,近期,中国-东盟区域医药交易(集采)平台助力国产手术机器人完成越南产品注册并取得上市许可,在越南部分头部医疗机构完成安装并投入临床应用,实现了国产大型医用设备在越南从产品注册到临床应用的重要突破。同时,还将推动中越双方就机器人手术技术培训、临床应用推广、学术交流、人才培养等方面开展深度合作。

花旗将希捷科技目标价从1240美元上调至1300美元。

花旗将希捷科技目标价从1240美元上调至1300美元。

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见。

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见。

韩国金融监管负责人就杠杆型ETF争议致歉 称将恢复市场信任

据报道,韩国主要金融监管机构负责人7月29日就单只股票杠杆型交易所交易基金(ETF)引发的市场争议公开致歉。

维谛技术美股盘前跌超6%。

维谛技术美股盘前跌超6%。