位置:首页 > 热点资讯 > Opus 5发布:性能媲美Fable 5,价格减半

Opus 5发布:性能媲美Fable 5,价格减半

时间:2026-07-27  |  作者:骑光打字机  |  阅读:0

刚刚,Anthropic 正式发布了新一代模型 Claude Opus 5。

刚刚,Opus 5来了:性能不输 Fable 5、价格砍半

时间点选得很有意思。几周前,Anthropic刚跟美国政府过了一招。几天前,OpenAI出的那档子事还在行业里发酵。挑在这个节骨眼上,到底是想把话题热度拉满,还是有别的考量?

官方博客的说法是:Claude Opus 5 是一款更具主动性、也更审慎的模型。智能水平直逼 Fable 5,但价格却只有后者的一半——这大概是今天最抓眼球的一句话。

在 Frontier-Bench、GDPval-AA 等编程与知识工作评测中,它已经刷新了行业最高纪录。唯一的小短板是网络安全任务,落后于 Mythos 5。不过整体来看,运行效率确实高出其他模型一大截,非常适合高频日常使用。目前它已经是 Claude Max 的默认模型,也是 Claude Pro 用户能用到的最强选项。

性能表现

和上一代 Opus 4.8 比,Opus 5 在成本不变的情况下,性能提升明显。用户可以通过「努力程度」(effort)设置来做权衡:调高就获得更强的智能,调低则更快、更省 token。这还不够,来看看具体数据。

编程方面

在 Frontier-Bench v0.1 中,Opus 5 直接碾压所有对手。得分是 Opus 4.8 的两倍以上,单任务成本反而更低。在 CursorBench 3.2 里,它在最高努力档位下与 Fable 5 的峰值成绩仅差 0.5%,但成本只有一半——注意,是整整一半。在 high、xhigh 和 max 三个档位上,同等成本下的表现全部领先其他模型。

知识工作与问题解决方面

成绩同样亮眼。ARC-AGI 3 考察的是模型解决全新问题的能力。Opus 5 的得分是第二名的三倍,这个差距大到有点离谱。Zapier AutomationBench 衡量端到端商业任务完成水平。同样单任务成本下,它的通过率是次优模型的 1.5 倍。哪怕调到最低努力档位,完成的任务数也比任何竞争者多。OSWorld 2.0 计算机操作基准中,它在任意成本点上都能胜过其他模型,并以约三分之一的成本超过了 Fable 5 的最佳成绩。多项相关评测下来,结论很一致:它既是最强的,也是最具性价比的。

科研能力显著进步

在生命科学领域,Opus 5 在每一项评测中都优于 Opus 4.8。覆盖了结构生物学、有机化学和生物信息学等方向。进步最猛的是有机化学:根据波谱数据推断分子结构的内部基准上,它比前代高出 10.2 个百分点。预测序列变异如何影响蛋白功能的评测中,提升了 7.7 个百分点。

可视化产出质量也大幅增强。举个例子,它能将空气流过空气动力学(和非空气动力学)物体的流动情况可视化。或者制作一个简化版的交互式细胞示意图。这些能力不只是炫技,对科研生产力是实实在在的加持。

更强的自主性与严谨性

Opus 5 更擅长核查自己的工作,并且能持续迭代直到成功。这一点在几个案例中体现得淋漓尽致。

在 Frontier-Bench 的一项任务中,模型需要根据一张机械零件图纸编写代码,用 FreeCAD 重建三维模型。但被刻意剥夺了直接查看图纸的途径。结果 Opus 5 自行编写了计算机视觉流水线,从原始像素中提取几何信息,最终完整重建了零件,而且能稳定复现。相同条件下,竞品模型尝试五次全部失败。

另一个案例:针对一款流行的开源软件包管理器中的真实漏洞,Opus 5 找到了根本原因,并修复了社区补丁遗漏的一个极端情况。而竞争对手的版本只修复了表面症状,根本没触及根本原因,然后就报告漏洞已解决。这就是深度思考和浅层修补的区别。

一家交易公司的工程师使用 Opus 5 在一次会话中就为一家新交易所构建了市场数据源。之前的模型根本无法完成这项任务,即使工程师提供了详尽的计划。由于没有可供验证的实时数据源,Opus 5 甚至自行构建了测试框架,来检查其代码是否正确解析了交易所的数据。这才是真正的智能,不是死记硬背。

对齐与安全:迄今最可靠的版本

Anthropic 在部署前的自动化行为审计中指出,Opus 5 是 Anthropic 迄今对齐程度最高的模型。它对 Claude 宪章的遵循度超过 Opus 4.8、Sonnet 5 和 Fable 5。欺骗行为发生率最低,也最难被诱导滥用。在避免可能造成难以逆转后果的鲁莽操作方面,它同样创下最佳纪录。

在自动化行为审计中,Opus 5 的整体不协调行为得分仅为 2.3,是 Anthropic 最近推出的模型中最低的。在高风险的两用能力上,它没有突破现有边界。

Anthropic 与私营部门及政府伙伴合作开展的严格评估表明,它在生物研究和进攻性网络安全两个方向都落后于 Mythos 5。团队延续了对 Opus 4.8 的做法,刻意不针对网络任务训练该模型。随着通用能力增强,模型在这类任务上仍有可观进步。发现安全漏洞的水平已接近 Mythos 5,但把漏洞转化为实际网络威胁的能力差距依然很大。

OSS-Fuzz 评测印证了这一点:两个模型识别漏洞的成功率相近。可在开发利用程序的环节,Opus 5 的得分远远落后。

分级防护:兼顾安全与可用

Opus 5 的防护体系与 Opus 4.8 大体一致,仅在少数网络任务上加强了限制。其网络安全分类器比 Fable 5 宽松,允许在源代码中查找漏洞。但会拦截二进制层面的漏洞扫描、渗透测试和利用程序生成——因为这些方法更常与恶意行为者相关。

据测试,分类器的干预频率预计比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,被拦截的请求默认回退至 Opus 4.8 处理。API 用户也可开启同样的回退机制。已加入网络验证计划(CVP)的企业和研究者,则可立即使用限制更少的版本。

生物方向的防护延续前代设计。这让 Opus 5 成为目前公开可用模型中科研能力最强的一款。不过它在长时程自主研究任务上仍有明显局限,而这恰是生物风险最集中的场景。Mythos 5 在此类工作上依然更强。本次发布后,在 Fable 5 上被拦截的生物类请求将改为路由至 Opus 5。

定价与新功能

Opus 5 即日起在所有平台上线。定价为每百万输入 token 5 美元、输出 25 美元,与前代持平,且只有 Fable 5 的一半,也略低于 OpenAI 的 GPT-5.6。

新推出的「极速模式」(Fast mode)以两倍价格提供约 2.5 倍的默认速度,目前处于研究预览阶段。用户还可选择开启自动回退:当安全分类器拦截 Opus 5 或 Fable 5 的请求时,系统会自动路由到其他可用模型,确保请求始终得到最佳模型的响应。

此外还有两项测试版更新:

  • Claude 平台支持在对话中途更换工具而不使提示缓存失效。
  • API 端支持上述自动回退功能。

与此前的 Opus 系列一致,Opus 5 的通用访问不设数据保留要求。

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多