性能逼近旗舰,价格直接减半!Anthropic 发布 Claude Opus 5
2026年7月25日 · 2947 字 · 6 分钟 · Claude Opus 5 Anthropic AI模型 Claude API AI编程

Claude Opus 5 最狠的升级,其实写在账单上:
能力逼近 Fable 5,API 单价直接减半。
如果你正在给 AI 编程、企业 Agent 或专业工作流选模型,这次发布值得认真看完。
大模型的竞争,已经从“谁最强”转向一个更现实的问题:
谁能用更少的钱,把最难的工作做完?
2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5。
官方描述:这是一款“步进式提升”的 Opus 模型,能力接近更高端的 Claude Fable 5,API 单价却只有后者的一半。
如果说 Fable 5 代表 Claude 家族不计成本追求能力上限,那么 Opus 5 更像一台真正准备进入日常生产环境的旗舰工作站:足够强,也更讲效率。
先看结论
Opus 5 的关键变化,可以浓缩成五点:
- 1M Token 上下文窗口,而且 1M 既是默认值也是上限,没有缩水的小窗口版本;
- 最大输出 128K Token,通过 Message Batches API 的 Beta 能力可扩展至 300K;
- API 价格为输入 5 美元/百万 Token、输出 25 美元/百万 Token,与 Opus 4.8 持平;
- Adaptive Thinking 默认开启,模型会根据任务难度自行决定思考量;
- 在编程、智能体、电脑操作和复杂知识工作上,性能明显超过 Opus 4.8,部分测试逼近甚至超过 Fable 5。
它还是 Claude Max 的默认模型,也是 Claude Pro 当前可用的最强模型。

从官方综合成绩看,Opus 5 并非每一项都拿第一。
例如在部分智能体编程、法律和健康测试中,Fable 5、Mythos 5 或 GPT-5.6 Sol 仍有优势。
但 Opus 5 真正可怕的地方,是它在多个核心项目上已经进入第一梯队,同时把价格压到了更容易日常使用的水平。
价格直接减半
先算一笔最直观的账:
- Claude Fable 5:输入 $10/MTok,输出 $50/MTok
- Claude Opus 5:输入 $5/MTok,输出 $25/MTok
- Claude Sonnet 5:输入 $3/MTok,输出 $15/MTok
Opus 5 的输入、输出单价都只有 Fable 5 的一半,并且与 Opus 4.8 保持一致。
这不代表每一个真实任务的最终账单都会精准减半。模型使用的 Token 数、工具调用次数和 Effort 档位都会影响成本。
但在 CursorBench 3.2 中,Opus 5 开到最高 Effort 后,峰值成绩距离 Fable 5 只有 0.5%,单任务成本约为后者一半。
Opus 5 最有吸引力的地方就在这里:“接近最高档的能力”被放进了更适合规模化使用的价格区间。
编程翻倍,GPT-5.6 Sol 呢?
在 Frontier-Bench v0.1 中,Opus 5 的最好成绩超过 Opus 4.8 的两倍,并且在官方测试里领先其他参测模型。

不过,真正让开发者感知明显的,可能不是多了多少百分点,而是它开始更像一个会对结果负责的工程师。
Anthropic 给出了几个很典型的案例:
- 面对无法直接查看的机械零件图,Opus 5 自己搭建了一套计算机视觉流程,从原始像素中提取几何信息,再重建 FreeCAD 3D 模型;
- 修复开源包管理器的真实 Bug 时,它不仅解决表面症状,还找到了社区补丁遗漏的边界条件;
- 为交易所开发行情数据接口时,因为没有实时数据可验证,它主动写了一套测试工具,检查解析结果是否正确。
这些案例指向同一种变化:模型开始主动验证、迭代,直到任务真正闭环。
对于 AI 编程来说,任务闭环比单次生成一段漂亮代码重要得多。
30.2%,但还不是 AGI
Opus 5 最抢眼的成绩,来自 ARC-AGI-3。
它取得了 30.2% 的成绩,而官方对比图中 GPT-5.6 Sol 的最佳成绩为 7.8%,差距接近四倍。Anthropic 将其概括为“下一名的三倍”。

这个结果说明 Opus 5 在陌生规则理解、抽象推理和新问题求解上有明显突破,但它仍然只完成了大约三成测试。
更准确的说法是:Opus 5 大幅刷新了这项测试的机器成绩,但距离通用智能仍然很远。
跑分可以证明能力边界正在移动,却不能替代真实业务中的稳定性、延迟、成本和人工验收。
Effort:新的成本旋钮
在 Opus 4.8 上,开发者需要主动开启 Adaptive Thinking。到了 Opus 5,思考已经成为默认行为。
模型会自己判断当前任务需要想多久,而用户可以通过 Effort 参数控制推理强度,共有五档:
low、medium、high、xhigh、max
默认档位是 high。
这套机制让同一个模型覆盖了更多任务:
- 简单整理、常规改写,可以降低 Effort,减少 Token 和等待时间;
- 复杂调试、架构设计、长周期智能体任务,可以提高 Effort,换取更深的推理;
- 不必为了每一种任务反复切换模型。
需要注意的是,max_tokens 同时限制思考内容与最终回答。
如果把 Effort 开到 xhigh 或 max,却仍保留很小的输出额度,模型可能还没完成推理就撞上上限。
1M 上下文,长任务更稳
Opus 5 的上下文窗口为 100 万 Token,标准同步 API 最大输出 12.8 万 Token。
在 Message Batches API 中,开发者还可以通过 output-300k-2026-03-24 Beta Header,将单次最大输出提高到 30 万 Token。
这更适合书籍草稿、长篇技术文档、大规模结构化抽取等异步任务。
它的可靠知识截止时间和训练数据截止时间均为 2026 年 5 月。
对刚发布的模型而言,这是一项很实用的优势。但需要最新资料时,仍然应该配合联网搜索和外部数据源。
3 个 Agent API 更新
除了模型本身,Anthropic 还同步推出了几个对智能体开发很实用的变化。
第一,中途更换工具。
开发者可以在同一段对话中增加或删除工具,同时保留提示词缓存。
以前工具列表一变,缓存往往随之失效;现在长流程 Agent 可以根据任务阶段动态调整能力。
第二,自动降级。
当 Opus 5 或 Fable 5 的请求触发安全分类器时,API 可以按照 Anthropic 推荐的策略自动路由到其他模型,而不是直接把整个流程卡死。
第三,更低的缓存门槛。
Opus 5 的最小可缓存提示词长度由 Opus 4.8 的 1024 Token 降至 512 Token。
对于系统提示词较短、调用频繁的应用,这能让更多请求享受到缓存读价格。
企业应用更早受益
Opus 5 在 Anthropic 的生命科学评估中全面超过 Opus 4.8。
其中,有机化学光谱推断提升 10.2 个百分点,蛋白质序列变化对功能影响的预测提升 7.7 个百分点。
这类提升不太容易成为社交平台上的“炸裂 Demo”,却可能在制药、生物信息学、金融研究、法律审阅和企业数据分析中产生更直接的价值。
安全方面,Anthropic 称 Opus 5 是其目前对齐程度最高的模型,在自动化行为审计中的总体不对齐行为得分为 2.3,低于近期其他 Claude 模型。
不过,“没有一般访问的数据留存要求”并不等于所有调用天然都是零数据留存。
企业仍需根据所用平台、功能和合同确认具体的数据保留政策。例如异步 Batch 任务为了处理和取回结果,本身就存在存储周期。
谁适合用?
如果你主要处理以下任务,Opus 5 很可能值得优先测试:
- 大型代码库中的重构、调试与代码审查;
- 需要连续使用多种工具的长周期 Agent;
- 财务、法律、科研等对推理和自我校验要求较高的专业工作;
- 过去想用 Fable 5,但成本难以规模化的业务。
如果只是摘要、翻译、简单问答或轻量脚本,Sonnet 5 依然可能更划算。
Fast Mode 虽然能带来约 2.5 倍速度,但价格也会变为基础 API 的两倍,即输入 $10/MTok、输出 $50/MTok。使用前同样需要算账。
短评
Claude Opus 5 的价值,远不止多一个更高跑分。
更重要的是,它把旗舰能力、长上下文、自适应思考和智能体执行力,放在了一个相对可控的成本里。
过去,企业做模型选型往往是在“能力”和“价格”之间二选一。
Opus 5 给出的新答案是:不必追求绝对最强,要看完成同一项任务时,能力、效率与成本能否形成最优组合。
这或许才是大模型进入生产环境后,真正决定胜负的指标。
你会把 Claude Opus 5 当作日常主力,还是继续使用更便宜的 Sonnet 5?欢迎在评论区聊聊。
我会持续跟进主流 AI 模型、Agent 和效率工具,把复杂参数翻译成能直接用于工作与选型的判断。
如果你不想被发布会跑分带着走,想知道一款模型值不值得用、适合什么任务、会多花多少钱,==关注我==。
觉得这篇梳理有用,也可以收藏起来,或转发给正在做模型选型的同事。
有帮助👉 「点赞」「转发」「小心心」
也欢迎在评论区 灵感流淌!