人工智能

Anthropic 发布 Claude Opus 5:接近 Fable 5 性能、成本约减半,成 Claude Max 默认模型

2026年7月25日 · admin
openmagic ad

据 IT之家 7 月 25 日消息,Anthropic 今日发布 Opus 系列最新旗舰模型 Claude Opus 5。这款模型在上一代 Opus 4.8 基础上提升了代码、知识工作与科研任务表现,同时官方称其价格维持不变。Anthropic 将 Opus 5 定位为面向日常高性能使用的模型:部分能力接近更高规格的 Claude Fable 5,但使用成本约为后者的一半。目前,Opus 5 已成为 Claude Max 服务默认模型,也是 Claude Pro 用户可使用的最高能力模型,并通过 Anthropic 平台和 Claude API 开放。

性能重点:代码、知识工作与 ARC-AGI 3 表现突出

从 Anthropic 公布的评测看,Opus 5 的核心卖点并不是单一跑分,而是“高能力 + 更低单位成本”。在 Frontier-Bench v0.1 中,Opus 5 超越其他模型,并将相对 Opus 4.8 的任务性能提升到两倍以上,同时单项任务成本更低。对于开发者常见的复杂代码任务,这意味着模型不仅更可能完成任务,也更适合在真实工作流中反复调用。

在 CursorBench 3.2 测试中,Opus 5 在最高努力模式下的成绩仅比 Fable 5 峰值低 0.5%,但每项任务成本约为 Fable 5 的一半。Anthropic 还称,在高、中高和最高努力设置下,Opus 5 的单位成本性能均超过其他模型。这类指标对企业采购更有参考价值,因为模型落地往往关注“完成同一任务要花多少钱”,而不仅是排行榜上的最高分。

在知识处理与问题解决方面,Opus 5 在 ARC-AGI 3、Zapier AutomationBench、OSWorld 2.0 等评测中取得较高成绩。其中,ARC-AGI 3 得分约为第二名的 3 倍;在用于衡量模型完成完整业务流程能力的 Zapier AutomationBench 中,通过率约为成本相近模型的 1.5 倍。这说明 Opus 5 的增强方向更偏向跨步骤推理、工具调用和自动化流程执行。

  • 代码与知识工作:Frontier-Bench、GDPval-AA 等测试中取得领先成绩。
  • 自动化能力:Zapier AutomationBench 通过率高于成本相近模型。
  • 科研任务:在有机化学、生物信息学、结构生物学等方向较 Opus 4.8 有提升。
  • 部署入口:已成为 Claude Max 默认模型,Pro 用户可使用,开发者可通过 Claude API 调用。

科研与真实任务:更强调自检、迭代和工具构建

Anthropic 还强调 Opus 5 在验证自身结果、持续迭代修正方面能力更强。来源显示,在一项根据机器零件图纸生成 FreeCAD 三维模型的测试中,模型无法直接查看图纸内容,但会自行编写计算机视觉流程,从原始像素中提取几何信息并完成模型重建。另一项测试中,Opus 5 发现了开源软件包管理器中的实际漏洞,并修复了社区补丁遗漏的问题。

科研任务上,Anthropic 称 Opus 5 相比 Opus 4.8 有明显提升,覆盖结构生物学、有机化学、生物信息学等领域。例如在根据光谱数据推断分子结构的有机化学任务中,Opus 5 比 Opus 4.8 高出 10.2 个百分点;在预测蛋白质序列变化对功能影响的任务中,高出 7.7 个百分点。对于中文科技读者而言,这显示主流大模型正从“聊天助手”继续向科研协作与专业工作代理演进。

安全与价格:限制更少,但高风险场景仍设边界

安全方面,Anthropic 表示 Opus 5 的安全限制相比 Fable 5 更少,预计安全分类器触发次数会减少约 85%。不过,它仍会限制部分高风险场景:在网络安全领域,模型可帮助分析源代码漏洞,但会阻止基于二进制文件的漏洞扫描、渗透测试以及漏洞利用代码生成等操作。Anthropic 称 Opus 5 并未专门接受网络攻击任务训练,但随着整体能力提升,漏洞发现能力也增强;在 OSS-Fuzz 测试中,其漏洞发现表现接近 Mythos 5,但将漏洞转化为实际攻击工具的能力仍明显落后。

价格方面,Claude Opus 5 输入价格为每百万词元 5 美元,输出价格为每百万词元 25 美元,与 Opus 4.8 保持一致。Anthropic 还推出 Opus 5 Fast 模式,运行速度约为默认模式的 2.5 倍,价格为基础价格的两倍。综合来看,Opus 5 的意义在于把接近顶级模型的能力下放到更常用的产品层级,并以相对可控的价格服务代码开发、企业自动化和科研分析场景。对 AI 工具市场而言,这会继续推高用户对“高性能默认模型”的预期,也会加速模型厂商围绕速度、成本和安全边界展开竞争。