现已上线 · 图表来自 Anthropic 官方

Claude Opus 5

接近 Fable 5 的智能,约一半的价格——Claude Max 的新默认模型,也是 Claude Pro 上最强可选模型。

Opus 5 到底是什么

跳过黑话。用四段话说清这次发布:适合谁、比以前强在哪、多少钱、以及今天怎么用。

谁该关注

如果你天天用 Claude 写代码、做研究或自动化——这就是 Anthropic 希望你用的模型。Max 用户默认就是它;Pro 用户可选计划内最强模型。

对比 Opus 4.8

标价相同(每百万 token 输入 $5 / 输出 $25)。在硬核编程基准上分数超过 4.8 的两倍,单次任务成本更低。同一账单,明显更好的结果。

对比 Fable 5

Fable 仍是 Claude 栈的绝对顶尖。Opus 5「几乎到顶」(例如 CursorBench 差距约 0.5%),成本大约一半——日常首选的前沿模型。

怎么开始

打开 Claude.ai / Claude Code,选择 Opus 5(或直接用 Max)。开发者在 API 调用 claude-opus-5。要更快?Fast mode 约 2.5× 速度、2× token 价格。

2026 年 7 月 24 日发布 — 现已可用

Claude Opus 5 已在 Claude.ai、Claude Code、Claude Cowork 与 Claude API 上线。Anthropic 把它定位为日常模型:更认真自检、更擅长长链条多步任务、比旧版 Opus 更省 token——且不涨 Opus 4.8 的价。

发布日期
2026/7/24全平台可用
Claude Max
新默认日常前沿编程与知识工作
Claude Pro
最强模型API 名:claude-opus-5

Anthropic 官方图表

图表来自7 月 24 日公告。多数图纵轴为分数(越高越好),横轴为成本(越靠左越便宜)。圆点表示「effort」档位:low → medium → high → xhigh → max——算力越多,智能越强。

怎么读这些图

  1. 越高越好 — 通过率 / Elo / 分数更高。
  2. 越左越便宜 — 横轴通常是对数成本(每任务或整次运行,单位美元)。
  3. 橙线是 Opus 5 — 黄线 Fable 5,蓝线 Opus 4.8,灰线常为 GPT-5.6 Sol。
  4. 最佳区域 — 左上角:成绩强且不烧预算。这正是 Anthropic 希望 Opus 5 落在的位置。

关键数字一览

Anthropic 的一张快照表。先看高亮的 Opus 5 列——别处桃色格表示该行另一模型胜出;Opus 5 上的桃色带表示「看这里」。

  • 43.3% Frontier-Bench — 硬核智能体编程;约为 Opus 4.8(21.1%)的 2 倍
  • 1861 GDPval-AA — 知识工作 Elo;榜上新高
  • 30.2% ARC-AGI-3 — 新颖谜题;约为下一列出模型的 3–4 倍
  • 26.0% AutomationBench — 端到端完成业务流程

来源 © Anthropic · Introducing Claude Opus 5

Anthropic Opus 5 基准汇总表,对比 Fable 5、Opus 4.8 与 GPT-5.6 Sol

前沿编程

如果你的工作是「智能体写代码、修代码」,这就是头条胜利:Frontier-Bench 上超过 Opus 4.8 两倍,且每次成功尝试仍更便宜。

近 Fable,半价

你不必总用绝对最顶尖的模型。CursorBench 上,Opus 5 在 max effort 时距 Fable 5 峰值约 0.5%,单次任务成本大约一半。

新颖解题

ARC-AGI 奖励发明解法,而不是背作业。Opus 5 相对下一模型约 3 倍的差距,正是 Anthropic 在文中强调推理跃升的原因。

端到端自动化

Zapier 基准问的是:整条业务流程做完了吗?同样花费下,Opus 5 通过率约为第二名的 1.5 倍——关心「能把活干完」的智能体时很有用。

与 Opus 4.8 同价 — 约为 Fable 5 的一半

MTok = 百万 token(大约是一大堆 API 读写的文字/代码)。$5 / $25 表示发送一百万输入 token 花 $5、一百万输出 token 花 $25——与 Opus 4.8 完全相同,换模型不改价目表。Anthropic 的主张:接近 Fable 的质量,约一半 Fable 成本。需要更低延迟可开 Fast mode(约 2.5× 速度,价格 2×)。

Claude Opus 4.8

$5 / $25

输入 $5 / MTok
输出 $25 / MTok

标价相同 — Opus 5 是升级版。

Claude Fable 5

~2× Opus 5

相对 Opus 5 ≈ ½ Fable 价格
CursorBench Opus 差距约 0.5%

据 Anthropic:接近 Fable 智能,约一半成本。

目前对齐最好的通用 Claude

错位(misalignment)图表上越低越好(Opus 5 为 2.3)。实际含义:在 Anthropic 审计中,欺骗或鲁莽行为少于 Opus 4.8、Sonnet 5 或 Fable 5。网络安全(OSS-Fuzz)上,它发现软件漏洞的能力接近 Mythos 5,但把漏洞变成可用利用的能力弱得多——这是 Anthropic 有意压低利用技能的设计。

Anthropic 自动化行为审计:Opus 5 错位行为分数最低
OSS-Fuzz:Opus 5 在漏洞识别上接近 Mythos 5,在利用上落后

大家常问

Claude Opus 5 怎么用?

已全平台上线。Claude Max 默认就是 Opus 5——直接聊天或打开 Claude Code 即可。Claude Pro 在模型列表里选最强即可。开发者把 API 模型名设为 claude-opus-5。需要更快可开 Fast mode(约 2.5× 速度、2× 价格)。

和 Opus 4 / 4.8 有什么不同?

与 Opus 4.8 标价相同(每百万 token $5 / $25),但强很多:编程基准大约翻倍,更认真自检,更擅长长链条智能体任务,知识工作(GDPval-AA)领先。Anthropic 也称它是目前对齐最好的通用 Claude。

该选 Opus 5 还是 Fable 5?

日常写代码与知识工作优先 Opus 5——接近 Fable 质量、约半价(CursorBench 距 Fable 约 0.5%)。只有需要 Claude 栈绝对顶尖且成本其次时,再选 Fable 5。

图上的「effort」是什么意思?

Effort(low → max)表示你让模型「想」多努力——更难的问题用更多 token 与工具。每张图通常用圆点标出这些档位:effort 升高,点往右/上移。Opus 5 常胜在:不用最贵那一档也能拿到高分。

这些图从哪来?

所有基准图均来自 Anthropic 文章 Introducing Claude Opus 5。本站是独立白话摘要,与 Anthropic 无隶属关系。

Claude Opus 5 — 发布日期、评测基准与价格(2026)