Claude Opus 5正式发布:高性能、高性价比、强自主性的新一代旗舰模型
摘要
全新旗舰模型上线:Claude Opus 5正式发布 Anthropic正式推出新一代旗舰大模型Claude Opus 5。该模型定位为日常高频使用的主力模型,已取代Opus 4.8成为Claude Max的默认模型,并作为Claude Pro中性能最强的选项向用...
全新旗舰模型上线:Claude Opus 5正式发布
Anthropic正式推出新一代旗舰大模型Claude Opus 5。该模型定位为日常高频使用的主力模型,已取代Opus 4.8成为Claude Max的默认模型,并作为Claude Pro中性能最强的选项向用户开放。
性能跃升显著,兼顾深度与效率
Opus 5在多项权威基准测试中刷新SOTA记录,尤其在软件工程、知识工作与复杂问题求解领域表现突出:
- Frontier-Bench v0.1:超越所有竞品,在单项任务成本降低的同时,性能达Opus 4.8的两倍以上;
- CursorBench 3.2(高努力模式):性能接近Fable 5峰值(仅差0.5%),但单任务成本仅为后者一半;在High/Xhigh/Max努力档位下,同等成本性能全面领先其他模型;
- ARC-AGI 3:解决全新未知问题能力极强,得分为第二名模型的3倍;
- Zapier AutomationBench:相同单任务成本下通过率约为第二名模型的1.5倍;最低努力设置下通过任务数仍高于其他所有模型;
- OSWorld 2.0:任意成本约束下均优于全部竞品,仅需略超三分之一成本即可超越Fable 5最佳成绩。
此外,在HLE、DeepSearchQA等评估中,Opus 5同样展现出最强综合性能与最优性价比。
科研能力实质性突破
在生命科学领域,Opus 5相较Opus 4.8实现系统性提升:
- 有机化学任务(如基于光谱推断分子结构):内部基准得分提升10.2个百分点;
- 蛋白质相关任务(如预测变异对功能影响):得分提升7.7个百分点。
模型还大幅强化视觉输出能力,可生成专业级空气动力学风洞图解、细胞结构互动图示等高信息密度图像内容。
主动思考与自我迭代能力升级
Opus 5展现出更强的“主动性”(Agency)与审慎执行能力,典型表现为:
- 自主构建视觉管线:面对无接口访问权限的机械图纸,自行编写CV流程提取几何特征,成功重建FreeCAD 3D模型,重复实验全部成功;而其他模型5次尝试均失败;
- 根治深层Bug:准确识别开源包管理器中的根本缺陷,修复社区补丁遗漏的边缘情况;竞品仅处理表层症状即宣告完成;
- 自建验证体系:为新交易所数据接入任务,在缺乏实时数据源条件下,自主构建完整测试套件验证解析逻辑准确性。
JetBrains IDE AI负责人指出,Opus 5在编码前更注重规划与逻辑自查,能在设计阶段提前发现自身推理漏洞,标志着解题能力的重要跨越。
安全对齐再加强
Opus 5是Anthropic迄今对齐程度最高的模型:
- 自动化行为审计显示其整体非对齐行为得分为2.3,为近期模型最低;
- 在《Claude's Constitution》合规性、抗诱导性、防误用能力等方面均优于Opus 4.8、Sonnet 5及Fable 5;
- 延续不对网络攻防任务进行专项训练的原则,但在通用能力提升带动下,漏洞发现能力已接近Mythos 5;漏洞利用(Exploit生成)能力仍明显受限,OSS-Fuzz评估证实其远低于Mythos 5。
网络安全分类器策略更精细:允许在源码中识别漏洞,但拦截二进制扫描、渗透测试及Exploit生成请求;被拦截时系统自动降级至Opus 4.8继续服务。生物科研场景沿用与Opus 4.8一致的安全防护机制,目前被视为最适配科研应用的通用模型之一。
实用设计与灵活定价
Opus 5维持与Opus 4.8完全一致的价格体系:
- 输入:5美元/百万Token;
- 输出:25美元/百万Token。
新增快速模式(Fast mode),运行速度约为默认模式的2.5倍,价格为基础价的2倍。模型支持动态调节“思考程度/努力程度”(Effort),用户可在智能深度与响应效率间按需平衡。
技术演进的新方向
Opus 5并非简单迭代,而是Anthropic在“高价值任务效能”与“实际使用成本”之间达成新平衡的标志性成果。它不追求单一维度的极致参数或峰值分数,而是聚焦真实场景下的交付质量、稳定性与可持续性。这种以任务闭环能力为核心的设计思路,正成为大模型从实验室走向产业落地的关键路径。
评论 (10)
Claude Opus 5取代旧版成默认,看来实力是真行。
科研能力提升,尤其生命科学领域,对科研帮助大。
不追求极致参数,注重实际场景,思路挺对。
这模型性能提升这么多性价比又高,科研能力也强,感觉能解决不少实际问题。
模型主动思考和自我迭代能力升级,解题能力有大跨越,厉害。
新模型安全对齐加强,还能拦截一些危险请求,用着更放心了。
价格和之前一样,还有快速模式,能按需调节,这设计挺实用。
这模型在多个领域都有出色表现,从实验室到产业落地有戏。
安全防护做得好,生物科研场景适配,适合科研用。
快速模式速度快,还能调节思考程度,很灵活