性能逼近旗舰,价格直接减半!Anthropic 发布 Claude Opus 5

2026年7月25日 · 2947 字 · 6 分钟 · Claude Opus 5 Anthropic AI模型 Claude API AI编程

性能逼近旗舰,价格直接减半!Anthropic 发布 Claude Opus 5 封面

Claude Opus 5 最狠的升级,其实写在账单上:

能力逼近 Fable 5,API 单价直接减半。

如果你正在给 AI 编程、企业 Agent 或专业工作流选模型,这次发布值得认真看完。

大模型的竞争,已经从“谁最强”转向一个更现实的问题:

谁能用更少的钱,把最难的工作做完?

2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5

官方描述:这是一款“步进式提升”的 Opus 模型,能力接近更高端的 Claude Fable 5,API 单价却只有后者的一半。

如果说 Fable 5 代表 Claude 家族不计成本追求能力上限,那么 Opus 5 更像一台真正准备进入日常生产环境的旗舰工作站:足够强,也更讲效率。

先看结论

Opus 5 的关键变化,可以浓缩成五点:

  • 1M Token 上下文窗口,而且 1M 既是默认值也是上限,没有缩水的小窗口版本;
  • 最大输出 128K Token,通过 Message Batches API 的 Beta 能力可扩展至 300K;
  • API 价格为输入 5 美元/百万 Token、输出 25 美元/百万 Token,与 Opus 4.8 持平;
  • Adaptive Thinking 默认开启,模型会根据任务难度自行决定思考量;
  • 在编程、智能体、电脑操作和复杂知识工作上,性能明显超过 Opus 4.8,部分测试逼近甚至超过 Fable 5。

它还是 Claude Max 的默认模型,也是 Claude Pro 当前可用的最强模型。

Claude Opus 5 官方综合基准对比

从官方综合成绩看,Opus 5 并非每一项都拿第一。

例如在部分智能体编程、法律和健康测试中,Fable 5、Mythos 5 或 GPT-5.6 Sol 仍有优势。

但 Opus 5 真正可怕的地方,是它在多个核心项目上已经进入第一梯队,同时把价格压到了更容易日常使用的水平。

价格直接减半

先算一笔最直观的账:

  • Claude Fable 5:输入 $10/MTok,输出 $50/MTok
  • Claude Opus 5:输入 $5/MTok,输出 $25/MTok
  • Claude Sonnet 5:输入 $3/MTok,输出 $15/MTok

Opus 5 的输入、输出单价都只有 Fable 5 的一半,并且与 Opus 4.8 保持一致。

这不代表每一个真实任务的最终账单都会精准减半。模型使用的 Token 数、工具调用次数和 Effort 档位都会影响成本。

但在 CursorBench 3.2 中,Opus 5 开到最高 Effort 后,峰值成绩距离 Fable 5 只有 0.5%,单任务成本约为后者一半。

Opus 5 最有吸引力的地方就在这里:“接近最高档的能力”被放进了更适合规模化使用的价格区间。

编程翻倍,GPT-5.6 Sol 呢?

在 Frontier-Bench v0.1 中,Opus 5 的最好成绩超过 Opus 4.8 的两倍,并且在官方测试里领先其他参测模型。

Frontier-Bench v0.1 不同 Effort 下的成绩与成本

不过,真正让开发者感知明显的,可能不是多了多少百分点,而是它开始更像一个会对结果负责的工程师。

Anthropic 给出了几个很典型的案例:

  • 面对无法直接查看的机械零件图,Opus 5 自己搭建了一套计算机视觉流程,从原始像素中提取几何信息,再重建 FreeCAD 3D 模型;
  • 修复开源包管理器的真实 Bug 时,它不仅解决表面症状,还找到了社区补丁遗漏的边界条件;
  • 为交易所开发行情数据接口时,因为没有实时数据可验证,它主动写了一套测试工具,检查解析结果是否正确。

这些案例指向同一种变化:模型开始主动验证、迭代,直到任务真正闭环。

对于 AI 编程来说,任务闭环比单次生成一段漂亮代码重要得多。

30.2%,但还不是 AGI

Opus 5 最抢眼的成绩,来自 ARC-AGI-3。

它取得了 30.2% 的成绩,而官方对比图中 GPT-5.6 Sol 的最佳成绩为 7.8%,差距接近四倍。Anthropic 将其概括为“下一名的三倍”。

ARC-AGI-3 成绩与评估成本对比

这个结果说明 Opus 5 在陌生规则理解、抽象推理和新问题求解上有明显突破,但它仍然只完成了大约三成测试。

更准确的说法是:Opus 5 大幅刷新了这项测试的机器成绩,但距离通用智能仍然很远。

跑分可以证明能力边界正在移动,却不能替代真实业务中的稳定性、延迟、成本和人工验收。

Effort:新的成本旋钮

在 Opus 4.8 上,开发者需要主动开启 Adaptive Thinking。到了 Opus 5,思考已经成为默认行为。

模型会自己判断当前任务需要想多久,而用户可以通过 Effort 参数控制推理强度,共有五档:

lowmediumhighxhighmax

默认档位是 high

这套机制让同一个模型覆盖了更多任务:

  • 简单整理、常规改写,可以降低 Effort,减少 Token 和等待时间;
  • 复杂调试、架构设计、长周期智能体任务,可以提高 Effort,换取更深的推理;
  • 不必为了每一种任务反复切换模型。

需要注意的是,max_tokens 同时限制思考内容与最终回答。

如果把 Effort 开到 xhighmax,却仍保留很小的输出额度,模型可能还没完成推理就撞上上限。

1M 上下文,长任务更稳

Opus 5 的上下文窗口为 100 万 Token,标准同步 API 最大输出 12.8 万 Token

在 Message Batches API 中,开发者还可以通过 output-300k-2026-03-24 Beta Header,将单次最大输出提高到 30 万 Token

这更适合书籍草稿、长篇技术文档、大规模结构化抽取等异步任务。

它的可靠知识截止时间和训练数据截止时间均为 2026 年 5 月

对刚发布的模型而言,这是一项很实用的优势。但需要最新资料时,仍然应该配合联网搜索和外部数据源。

3 个 Agent API 更新

除了模型本身,Anthropic 还同步推出了几个对智能体开发很实用的变化。

第一,中途更换工具。

开发者可以在同一段对话中增加或删除工具,同时保留提示词缓存。

以前工具列表一变,缓存往往随之失效;现在长流程 Agent 可以根据任务阶段动态调整能力。

第二,自动降级。

当 Opus 5 或 Fable 5 的请求触发安全分类器时,API 可以按照 Anthropic 推荐的策略自动路由到其他模型,而不是直接把整个流程卡死。

第三,更低的缓存门槛。

Opus 5 的最小可缓存提示词长度由 Opus 4.8 的 1024 Token 降至 512 Token

对于系统提示词较短、调用频繁的应用,这能让更多请求享受到缓存读价格。

企业应用更早受益

Opus 5 在 Anthropic 的生命科学评估中全面超过 Opus 4.8。

其中,有机化学光谱推断提升 10.2 个百分点,蛋白质序列变化对功能影响的预测提升 7.7 个百分点

这类提升不太容易成为社交平台上的“炸裂 Demo”,却可能在制药、生物信息学、金融研究、法律审阅和企业数据分析中产生更直接的价值。

安全方面,Anthropic 称 Opus 5 是其目前对齐程度最高的模型,在自动化行为审计中的总体不对齐行为得分为 2.3,低于近期其他 Claude 模型。

不过,“没有一般访问的数据留存要求”并不等于所有调用天然都是零数据留存。

企业仍需根据所用平台、功能和合同确认具体的数据保留政策。例如异步 Batch 任务为了处理和取回结果,本身就存在存储周期。

谁适合用?

如果你主要处理以下任务,Opus 5 很可能值得优先测试:

  • 大型代码库中的重构、调试与代码审查;
  • 需要连续使用多种工具的长周期 Agent;
  • 财务、法律、科研等对推理和自我校验要求较高的专业工作;
  • 过去想用 Fable 5,但成本难以规模化的业务。

如果只是摘要、翻译、简单问答或轻量脚本,Sonnet 5 依然可能更划算。

Fast Mode 虽然能带来约 2.5 倍速度,但价格也会变为基础 API 的两倍,即输入 $10/MTok、输出 $50/MTok。使用前同样需要算账。

短评

Claude Opus 5 的价值,远不止多一个更高跑分。

更重要的是,它把旗舰能力、长上下文、自适应思考和智能体执行力,放在了一个相对可控的成本里。

过去,企业做模型选型往往是在“能力”和“价格”之间二选一。

Opus 5 给出的新答案是:不必追求绝对最强,要看完成同一项任务时,能力、效率与成本能否形成最优组合。

这或许才是大模型进入生产环境后,真正决定胜负的指标。

你会把 Claude Opus 5 当作日常主力,还是继续使用更便宜的 Sonnet 5?欢迎在评论区聊聊。


我会持续跟进主流 AI 模型、Agent 和效率工具,把复杂参数翻译成能直接用于工作与选型的判断。

如果你不想被发布会跑分带着走,想知道一款模型值不值得用、适合什么任务、会多花多少钱==关注我==

觉得这篇梳理有用,也可以收藏起来,或转发给正在做模型选型的同事。

有帮助👉 「点赞」「转发」「小心心」

也欢迎在评论区 灵感流淌!