风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

Claude Opus 5正式发布:高性能、高性价比、强自主性的新一代旗舰模型

摘要

全新旗舰模型上线:Claude Opus 5正式发布 Anthropic正式推出新一代旗舰大模型Claude Opus 5。该模型定位为日常高频使用的主力模型,已取代Opus 4.8成为Claude Max的默认模型,并作为Claude Pro中性能最强的选项向用...

Claude Opus 5正式发布:高性能、高性价比、强自主性的新一代旗舰模型

全新旗舰模型上线:Claude Opus 5正式发布

Anthropic正式推出新一代旗舰大模型Claude Opus 5。该模型定位为日常高频使用的主力模型,已取代Opus 4.8成为Claude Max的默认模型,并作为Claude Pro中性能最强的选项向用户开放。

性能跃升显著,兼顾深度与效率

Opus 5在多项权威基准测试中刷新SOTA记录,尤其在软件工程、知识工作与复杂问题求解领域表现突出:

  • Frontier-Bench v0.1:超越所有竞品,在单项任务成本降低的同时,性能达Opus 4.8的两倍以上;
  • CursorBench 3.2(高努力模式):性能接近Fable 5峰值(仅差0.5%),但单任务成本仅为后者一半;在High/Xhigh/Max努力档位下,同等成本性能全面领先其他模型;
  • ARC-AGI 3:解决全新未知问题能力极强,得分为第二名模型的3倍;
  • Zapier AutomationBench:相同单任务成本下通过率约为第二名模型的1.5倍;最低努力设置下通过任务数仍高于其他所有模型;
  • OSWorld 2.0:任意成本约束下均优于全部竞品,仅需略超三分之一成本即可超越Fable 5最佳成绩。

此外,在HLE、DeepSearchQA等评估中,Opus 5同样展现出最强综合性能与最优性价比。

科研能力实质性突破

在生命科学领域,Opus 5相较Opus 4.8实现系统性提升:

  • 有机化学任务(如基于光谱推断分子结构):内部基准得分提升10.2个百分点;
  • 蛋白质相关任务(如预测变异对功能影响):得分提升7.7个百分点。

模型还大幅强化视觉输出能力,可生成专业级空气动力学风洞图解、细胞结构互动图示等高信息密度图像内容。

主动思考与自我迭代能力升级

Opus 5展现出更强的“主动性”(Agency)与审慎执行能力,典型表现为:

  • 自主构建视觉管线:面对无接口访问权限的机械图纸,自行编写CV流程提取几何特征,成功重建FreeCAD 3D模型,重复实验全部成功;而其他模型5次尝试均失败;
  • 根治深层Bug:准确识别开源包管理器中的根本缺陷,修复社区补丁遗漏的边缘情况;竞品仅处理表层症状即宣告完成;
  • 自建验证体系:为新交易所数据接入任务,在缺乏实时数据源条件下,自主构建完整测试套件验证解析逻辑准确性。

JetBrains IDE AI负责人指出,Opus 5在编码前更注重规划与逻辑自查,能在设计阶段提前发现自身推理漏洞,标志着解题能力的重要跨越。

安全对齐再加强

Opus 5是Anthropic迄今对齐程度最高的模型:

  • 自动化行为审计显示其整体非对齐行为得分为2.3,为近期模型最低;
  • 在《Claude's Constitution》合规性、抗诱导性、防误用能力等方面均优于Opus 4.8、Sonnet 5及Fable 5;
  • 延续不对网络攻防任务进行专项训练的原则,但在通用能力提升带动下,漏洞发现能力已接近Mythos 5;漏洞利用(Exploit生成)能力仍明显受限,OSS-Fuzz评估证实其远低于Mythos 5。

网络安全分类器策略更精细:允许在源码中识别漏洞,但拦截二进制扫描、渗透测试及Exploit生成请求;被拦截时系统自动降级至Opus 4.8继续服务。生物科研场景沿用与Opus 4.8一致的安全防护机制,目前被视为最适配科研应用的通用模型之一。

实用设计与灵活定价

Opus 5维持与Opus 4.8完全一致的价格体系:

  • 输入:5美元/百万Token;
  • 输出:25美元/百万Token。

新增快速模式(Fast mode),运行速度约为默认模式的2.5倍,价格为基础价的2倍。模型支持动态调节“思考程度/努力程度”(Effort),用户可在智能深度与响应效率间按需平衡。

技术演进的新方向

Opus 5并非简单迭代,而是Anthropic在“高价值任务效能”与“实际使用成本”之间达成新平衡的标志性成果。它不追求单一维度的极致参数或峰值分数,而是聚焦真实场景下的交付质量、稳定性与可持续性。这种以任务闭环能力为核心的设计思路,正成为大模型从实验室走向产业落地的关键路径。

评论 (10)

登录 后即可发表评论
用户8020979329304

Claude Opus 5取代旧版成默认,看来实力是真行。

0 回复
绿色的记忆

科研能力提升,尤其生命科学领域,对科研帮助大。

0 回复
小辉哥
小辉哥 1周前

不追求极致参数,注重实际场景,思路挺对。

0 回复
123aoe
123aoe 1周前

这模型性能提升这么多性价比又高,科研能力也强,感觉能解决不少实际问题。

0 回复
九九归一

模型主动思考和自我迭代能力升级,解题能力有大跨越,厉害。

0 回复
更多