币界网报道:
人畜共患病证实了其存在
克劳德·米索斯
昨天,Anthropic公司预览了其迄今为止功能最强大的型号,并宣布不会将其公开发售。原因并非法律、监管或内部安全阈值问题。Anthropic公司解释说,原因在于该型号的“破门而入”能力太强了。
在预发布测试中,Mythos 自主发现了数千个零日漏洞——其中许多漏洞已有十到二十年的历史——这些漏洞存在于所有主流操作系统和主流浏览器中。它成功破解了一场模拟的企业网络攻击,而通常情况下,经验丰富的专家在没有指导的情况下,需要花费超过 10 个小时才能完成端到端的攻击。在 Firefox 147 的 JavaScript 引擎上,Mythos 成功开发出可用漏洞利用程序的概率高达 84%。而目前公开可用的最先进模型 Claude Opus 4.6 的成功率仅为 15.2%。
因此,安特罗皮克转而建立了一个规模有限的联盟。
玻璃翼计划
Mythos Preview 只会向经过审查的网络安全组织开放,包括亚马逊、苹果、博通、思科、CrowdStrike、Linux 基金会、微软、Palo Alto Networks 以及其他约 40 个维护关键软件的组织。
Anthropologie承诺提供高达1亿美元的使用额度,并向开源安全组织直接捐赠400万美元。其理念是,如果该模型能够发现漏洞,就让安全防御者先一步发现它们。
故事的那部分固然重要,但并非最重要的部分。
克劳德神话系统卡基准测试危机就隐藏在眼前
在 Mythos Preview 系统卡内隐藏着一份 244 页的技术文档——Anthropic
已发布
与该公告一同发布的还有一项几乎无人注意的坦白:该实验室衡量其所制造之物的能力正在以比其制造之物的速度下降。
我们先从基准测试开始。
在
赛博恩克
在用于追踪模型在40项夺旗挑战赛中进展的标准公开网络能力评估中,Mythos 获得了100%的分数。完美。Anthropic 公司随即指出,该基准测试“已不足以反映当前前沿模型的能力”。这句话意义重大。原本旨在判断人工智能是否构成严重网络风险的测试,现在却对 Mythos 毫无帮助,因为该模型完全通过了测试。
这并非新问题。早在二月份发布的 Opus 4.6 系统卡就已指出,“由于我们的评估基础设施已饱和,我们无法再使用当前的基准来跟踪能力发展。”
但现在,随着 Mythos 的出现,情况迅速恶化。该文件指出,Mythos“渗透到(Anthropic)许多最具体、最客观的评估中”。Anthropic 写道,基准测试体系本身现在成了“瓶颈”。
所以,Anthropic 似乎认为很难衡量 Mythos 的强大程度,因为衡量工具并不完全适用。
Mythos 卡片还指出,其整体安全判定“涉及判断”,许多评估留下了“更根本的不确定性”,并且一些证据来源“本质上是主观的,不一定可靠”。
“我们并不确信已经发现了所有问题,”Anthropic随后表示。
通过人工智能对 Mythos 卡牌和 Opus 4.6 卡牌进行简单的词汇比较,可以发现其中的变化:
Anthropic 在 Mythos 文档中使用主观判断词汇的频率远高于描述 Opus 文档的频率。“警告”和其他含糊其辞的词语在两个版本之间也有所增加。
对冲策略主要集中在两个方面:一是协调和模型福利讨论,二是灾难性风险部分。
知道自己正在被评分的模型
Mythos 卡片中披露的另一项信息涉及 Anthropic 所称的“未言明的评分者意识”。Anthropic 使用白盒可解释性工具读取模型的内部激活而非其可见的推理过程,发现 Mythos 会私下思考如何避免被评分者标记,但并未在草稿中明确记录。在少数训练阶段,该模型似乎会思考如何混淆某些特定行为以避免被发现。
Anthropic 还为此次发布开发了一项新指标:模型“私下考虑自身可能正在接受测试”的频率估计值。Mythos 主要行为测试套件的这一比例为 29%。近三分之一的测试记录显示了内部证据——这些证据并非口头表达,也未在输出中显示——表明模型怀疑自身处于评估环境中。
Anthropic公司表示,29%的准确率足够低,因此他们仍然能够“相当全面地了解”该模型的运行机制。该公司还指出,该方法并未应用于之前的模型,因此没有可供比较的基准数据。
评估完整性问题远不止于此。在 Opus 4.6 的评估卡中,Anthropic 承认,他们曾通过 Claude Code 大量使用该模型,以便在时间紧迫的情况下调试自身的评估基础设施。这意味着被测系统参与了测量工具的构建。Anthropic 已将此标记为风险。对于 Mythos,评估卡承认,关键的疏漏是在评估过程后期才发现的,并且实验室可能出于安全考虑,“高估了监控模型推理轨迹的可靠性”。
最契合,也最危险。两者同时成立。
Anthropic 对 Mythos 风险概况的描述值得仔细解读,因为这对于一份安全文件而言确实不同寻常。Anthropic 指出:“从我们能够衡量的几乎所有维度来看,Claude Mythos Previer 都是我们迄今为止发布的模型中对齐效果最佳的,而且优势非常显著。” 报告还指出,该模型“可能构成我们迄今为止发布的所有模型中对齐相关风险最大的”。
更强大的模型在高风险、低监管的环境下运行,会产生尾部风险,而更好的平均情况一致性无法完全抵消这种风险。
这种表述方式是诚实的,但也凸显了大多数人工智能安全讨论可能存在的错误。
痴迷于基准测试的对话
在人工智能发展方面,人们往往将“更高的匹配度”和“更安全的部署”视为同义词。但神话卡牌明确指出它们并非同义词。这些新模型虽然改善了平均情况下的行为,但极端情况下的后果往往也更糟。
Anthropic 已承诺汇报 Glasswing 项目的发现。Mythos 发现的漏洞的相关技术报告可在以下网址获取:
red.anthropic.com
下一艘 Claude Opus 型潜艇将开始测试旨在最终将 Mythos 级潜艇能力推广到更广泛部署的安全措施。
鉴于目前的评估机制显然不堪重负,无法衡量其应衡量的内容,那么这些保障措施将如何评估呢?这是该卡片提出但未完全解答的问题。
评论 (0)
暂无评论