最后更新时间:2026-07-27
Claude Opus 5 评测:官方指标、价格与实战选型
Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,模型 ID 为 claude-opus-5。它最值得关注的不是单一排行榜名次,而是把 1M token 上下文、128K 最大输出、默认开启的 adaptive thinking,以及五档 effort 控制放进同一套面向长程代理任务的模型里。官方图表显示,它在 Frontier-Bench v0.1 的特定内部运行配置中,以低于 Opus 4.8 的单次成本获得超过两倍的分数;在 ARC-AGI-3 图中,high effort 的点约为 30%,明显高于同图的 Opus 4.8。1
这篇 Claude Opus 5 评测面向需要决定“何时该上最强模型、何时该降 effort 控成本”的开发者、产品负责人和内容团队。结论先说:复杂多文件改造、需要反复用工具验证的任务,以及超长资料归纳,Opus 5 值得进入候选;短问答、批量分类和低风险格式转换,不应默认使用它。官方评测可说明能力上限,不能替代你自己的代码库、数据分布和预算下的验收。
快速结论:Claude Opus 5 的 API 标准价是每百万输入 token 5 美元、每百万输出 token 25 美元;Fast mode 为 10/50 美元。先用默认
high做 20 个真实样本,再比较medium、high、xhigh三档的通过率、总 token 与人工返工时间,才是可靠的选型方式。12
Claude Opus 5 官方指标一览
| 项目 | 官方信息 | 对选型的含义 |
|---|---|---|
| 发布日期 | 2026 年 7 月 24 日 | 以发布页和最新文档为准,不沿用旧版 Opus 参数 |
| API 模型 ID | claude-opus-5 |
可作为升级或灰度实验的独立模型名 |
| 上下文窗口 | 1M token | 适合长文档、代码仓库与多轮工具轨迹,但仍要控制无关上下文 |
| 最大输出 | 128K token | 适合长计划与复杂代码产出,max_tokens 同时限制思考与可见输出 |
| 标准 API 价格 | 输入 5 美元/MTok,输出 25 美元/MTok | 先测总成本,而非只看输入单价 |
| Fast mode | 约为默认速度的 2.5 倍;10/50 美元/MTok | 仅 Claude API research preview,不能假设云平台同样可用 |
| effort 档位 | low、medium、high、xhigh、max |
以任务风险调节推理深度,而不是把最高档当默认值 |
这里有两个容易忽略的变化。第一,Opus 5 默认开启 thinking,API 请求中的 max_tokens 是思考 token 与最终文本的总硬上限;从旧版迁移时,原本能返回的可见文本长度可能会变化。第二,提示词缓存的最小可缓存长度从 Opus 4.8 的 1,024 token 降到 512 token,对反复执行的短系统提示词和固定工具说明更友好。23
官方评测图怎么看:先看坐标与实验条件
下面两张图均为 Anthropic 发布页的原始图表,本站仅本地保存以便阅读,并未修改图中指标。它们反映的是厂商公布的测试设置,不是本站复测,也不代表每个业务任务都会获得相同比例的提升。

图表出处见 Anthropic 官方发布资料。1
Frontier-Bench:比较的是“分数与每次尝试成本”
图 1 的 Opus 5 橙色曲线从约 5.5 美元、25.5% 起步,在约 14.5 美元处达到约 44.3%,随后在约 17 美元处约 43.2%。同图的 Opus 4.8 蓝色曲线最高约 18.7%,对应成本约 17 美元;Fable 5 黄色曲线最高约 33.7%,成本接近 27 美元。换言之,图所展示的是在该 harness 与 effort 梯度下,Opus 5 把更高的代理编程得分放在了更低的单次尝试成本区间。
但不能把这张图简化为“成本低一半、所有编码任务都好两倍”。图下明确写有每个任务最多四次尝试、Opus 4.8 因安全分类拒绝采用均值回退等条件;此外,真实团队还会受到代码库质量、测试覆盖、工具权限、重试策略和人工审查门槛影响。更可操作的读法是:把它当成设置实验起点,优先验证多步改造、排错闭环、浏览器检查等长程任务。

图表出处见 Anthropic 官方发布资料。1
ARC-AGI-3:别把总评测成本当成日常账单
图 2 表达的是新颖问题求解与整套评测成本的关系。Opus 5 的 high 点约为 30%,同图 Opus 4.8 的 high 约 1.4%,GPT-5.6 Sol 的点约在 7% 至 8% 范围。这里的横轴标为“total evaluation cost”,约在 1 万至 2.4 万美元的区间,因此它不能直接推出“每次调用 Opus 5 要 2 万美元”,更不能代替你在 API 控制台中的实际用量。
官方发布页还给出三个定性或相对结论:ARC-AGI 3 分数约为次优模型的三倍;AutomationBench 在相同单任务成本下的通过率约为次优模型的 1.5 倍;OSWorld 2.0 在任一给定成本下优于其他模型,并以略高于 Fable 5 最佳结果三分之一的成本超过该结果。1 这些都是发布方的比较陈述。采购或上线前,应要求用同一提示词、工具集、超时阈值和重试次数进行内部复验。
为什么 effort 比“模型名”更影响账单
Opus 5 的五档 effort 不是装饰性参数。官方文档说明,模型默认是 high,可向下调到 low、medium,也可为最难任务升至 xhigh 或 max;更高档位通常应预留更大的 max_tokens,让模型完成思考、子任务和工具调用。2
建议把任务拆成三类。第一类是格式固定、可快速抽检的工作,例如标签归类、字段提取和短摘要,先测 low 或 medium。第二类是需要查资料、写单元测试、修一个明确 bug 的工作,用 high 建立基准。第三类是跨目录重构、从需求到可演示页面、需要多轮浏览器或命令行验证的工作,才值得把 xhigh、max 放进受控实验。
effort 的选择还要和任务的可回滚性绑定。可以只改隔离分支、能自动运行测试、输出可由机器断言的任务,适合逐步尝试更高档位;会写入客户数据、调用付费第三方服务或触达生产环境的任务,即使模型在基准上更强,也应先收紧工具权限和审批范围。模型能力的提升不会自动补上流程控制,更不能用一次演示成功替代持续评估。把失败样本单独归档,区分“没理解需求”“工具调用失败”“验证不足”和“成本超标”,下一轮实验才有明确优化方向。
一个可复用的验收表应至少记录:任务是否通过、首次可用结果耗时、输入与输出 token、工具调用次数、人工修订分钟数,以及是否引入回归。只比模型输出“看起来聪明”会漏掉最重要的成本:失败后重新解释上下文、补测试和处理不可复现结果的时间。
任务:为现有服务增加导出接口并补齐测试
验收:接口测试全绿;导出文件字段正确;无既有测试回归
对照:medium / high / xhigh 各运行 20 次,同一仓库快照与工具权限
记录:通过率、P50/P95 时长、总 token、人工修订分钟数、失败类型
决策:以“每个通过任务的总成本”排序,而非以单次请求价格排序
API 接入时的三个迁移点
第一,模型名要显式固定为 claude-opus-5,在灰度期不要用“最新 Opus”这类不可审计的别名。第二,若从 Opus 4.8 迁移,检查是否曾显式禁用 thinking:在 Opus 5 上,thinking: {"type":"disabled"} 仅能与 high 或更低 effort 共用;若与 xhigh、max 组合,官方文档说明会返回 400 错误。2
第三,Fast mode 不是单纯的低延迟开关。官方将其列为 Claude API 的 research preview,价格翻倍,当前不适用于 Amazon Bedrock、Google Cloud 或 Microsoft Foundry。面向交互式编辑器可以测它的 P95 延迟收益;面向异步批处理则先比较标准模式、缓存命中和 Batch API 折扣,往往更接近实际成本优化。
from anthropic import Anthropic
client = Anthropic()
message = client.messages.create(
model="claude-opus-5",
max_tokens=8192,
output_config={"effort": "high"},
messages=[{"role": "user", "content": "先列出修改计划,再实现并说明验证步骤。"}],
)
print(message.content[0].text)
以上示例只展示模型选择和 effort 的位置。生产环境还应加入请求超时、幂等键、预算上限、敏感数据最小化和工具白名单;让模型拥有更多 token 或更多工具,不等于应当拥有更广的生产权限。
国内使用与多模型工作流怎么安排
国内团队常见的问题不是“有没有最强模型”,而是如何让网页试验、团队协作和工程 API 分层。查权威规格、发布日期和迁移边界时,应以 Claude 官方文档为准;要做同题 Prompt 对照、培训或内容验证,可在 gemini官网 信息与 gemini中文版 场景中先固定输入;进入程序化调用后,再用独立密钥、预算和日志验证 Claude API。
对于希望把 Claude、Gemini 与其他模型放在同一工作台比较的团队,gemini镜像站 与 gemini 国内使用 入口更适合做页面侧任务验证;最终选型仍需回到版本号、模型可用性、数据边界和 API 用量报表。不要因为界面能选到一个名称,就推断它等同于 Anthropic 官方 API 的特定版本。
建议把网页侧试验和正式调用使用同一份任务卡:固定输入材料、预期格式、不得触碰的数据、允许的工具与验收人。这样在不同模型、不同入口之间出现质量差异时,团队能定位差异来自模型版本、Prompt、权限还是测试标准,而不是只凭主观印象决定去留。
常见问题
Claude Opus 5 适合所有编程任务吗?
不适合。它的官方定位偏向复杂代理编程与企业工作。短代码补全、规则明确的转换和批量低风险任务,应先测试较低 effort 或更轻模型;只有在通过率、返工和时延综合收益明显时,再扩大 Opus 5 用量。
官方评测图可以证明我的业务也会提升吗?
不能直接证明。官方图说明特定基准、harness、成本口径和 effort 配置下的结果。你的任务若使用不同工具、私有代码、语言、超时或审查规则,结果可能不同。最小可行做法是用 20 个固定样本做盲评对照。
Claude Opus 5 的 1M 上下文能否直接塞入全部资料?
技术上有 1M token 上下文,但不建议把无关资料一次性全部送入。先按任务筛选、标注来源和冲突,再用检索或分段摘要保留关键证据,通常更容易降低费用、提高可追溯性,也更利于发现过期信息。
应该直接从 Claude Opus 4.8 全量切换到 Opus 5 吗?
不建议直接全量切换。先固定模型 ID 和系统提示词,在影子流量或非关键任务上跑一周,对比通过率、拒答、格式稳定性、总 token 与 P95 延迟。尤其要检查 thinking 默认开启后 max_tokens 是否足够,以及禁用 thinking 的旧请求是否与 effort 设置冲突;确认无回归后再分批放量。
结论:把官方领先转化成可验证的工作流
Claude Opus 5 的发布信号很清晰:Anthropic 把长程代理任务、可调推理深度和成本曲线作为核心竞争点。Frontier-Bench 与 ARC-AGI-3 官方图值得参考,但它们的正确用途是帮助你设计内部实验,而不是替你完成采购决策。
从 high 开始,用固定样本记录通过率、总 token、延迟和人工返工,再决定是否升级到更高 effort。需要先在网页侧对比同一 Prompt 的团队,可以从 AIMirror Gemini 中文站 做任务验证;涉及正式集成时,仍应以 Anthropic 官方 API 文档、模型 ID 与安全边界为最终依据。