克劳德作品 5 今天发布。对于企业来说,它的运行成本比 Anthropic 的领先模型 Claude Fable 5 更便宜,该公司将其定位为付费用户的日常前沿产品。更重要的是,Opus 5 在重要基准测试中的表现也优于它。

要了解 Opus 5 的适合位置:Anthropic 的产品线分为四个级别。 Haiku 又快又便宜。十四行诗是中档的。 Opus 是重型主力。其之上是 Mythos 类(今年春天推出的 Anthropic 级别),其中包括面向公众的 Claude Fable 5,以及通过 Project Glasswing 为经过审查的网络安全研究人员和关键基础设施运营商保留的限制较少的 Claude Mythos 5 版本。

《神鬼寓言 5》作为用户旗舰游戏的表现并不好。它于 6 月 9 日推出,三天后在美国政府以越狱漏洞为由发布紧急出口管制令后在全球范围内下架,并于 6 月 30 日重新推出,但又立即转变为纯积分模式,不再包含在标准计划中。 《Opus 5》现在填补了《神鬼寓言 5》无法填补的空缺。

Lovable 是一个拥有数百万用户的开发者平台,在其内部评估中运行了 Opus 5,并指出其收益超出了原始分数:“它不仅在我们最困难的代理编码任务上表现更好,比 Opus 4.7 提高了 22%,而且更稳定,运行之间的差异要小得多,”Fabian Hedin 在 Anthropic 分享的一份声明中表示。

基准测试

这听起来可能很奇怪,但 Opus 在几乎所有对日常用户重要的方面都击败了《寓言》,同时又不像《寓言》那样被贴上神话级的标签。

在 Frontier-Bench v0.1(测试 AI 编码代理是否能够端到端完成真实软件工程任务的基准测试,以通过任务的百分比进行评分)上,Opus 5 达到了 43.3%。 《神鬼寓言 5》的收视率为 33.7%。 Anthropic 的主要商业竞争对手 OpenAI 的 GPT-5.6 Sol 得分为 34.4%。

差距最大的是 ARC-AGI-3,这是一项围绕模型无法从训练数据中记住的新谜题构建的真正解决问题的测试,以已解决谜题的百分比进行评分。 Opus 5 达到 30.2%; GPT-5.6 Sol 得分 7.8%; 《神鬼寓言 5》根本没有经过测试。在 GDPval-AA v2(通过 Elo 评级(一种用于衡量真实专业任务相对表现的国际象棋式排名系统)进行评分的知识工作基准)上,Opus 5 达到了 1,861,而《神鬼寓言 5》为 1,747,GPT-5.6 Sol 为 1,736。

Zapier 在 AutomationBench 上测试了 Opus 5,该评估对模型是否可以在没有人工帮助的情况下从头到尾承载完整的业务工作流程进行评分。他们的结论是:该模型“采用了原始帐户健康工作簿,并从头到尾运行了完整的流失预防序列:标记有风险的帐户,向正确的所有者发出警报,并总结保留操作。以前的模型没有通过;Opus 5 达到了 100%。”

Anthropic 还将 Opus 5 视为研究升级。 DNA 测序公司 Ultima Genomics 表示,该模型“比我们运行过的任何模型都更像一位细心的科学家。它采用正确的统计测试来排除混杂因素,通过独立方法交叉检查自己的结果,并通过长时间的多步骤分析保持在正轨上。”

也就是说,法律和健康这两个领域是《神鬼寓言 5》唯一以微弱优势领先的领域。

阿里巴巴支持的北京初创公司 Moonshot AI 发布了 Kimi K3,这是一个 2.8 万亿参数的开放权重模型(意味着任何人都可以下载底层代码来独立运行),Moonshot 称其为世界上最大的开放人工智能系统。独立基准测试一致将 Kimi K3 评为第三名,落后于《神鬼寓言 5》和 GPT-5.6 Sol,并在特定领域击败了这两者。

Opus 5 is available now via API at $5 per million input tokens and $25 per million output. (Tokens are the basic unit of information an AI model can process in both input and output).还可以以大约 2.5 倍默认速度运行的快速模式,价格是基本价格的两倍——每百万输入代币 10 美元,每百万输出 50 美元。

此次发布可能会结束人们对《神鬼寓言 5》缺乏公众可用性的担忧。每个人也可以通过订阅获得 Opus。