Cursor Composer 2.5新模型发布:性能对标顶级模型,成本仅1/10
2026年5月20日 · 1912 字 · 4 分钟 · Cursor AI编程 Composer 大模型 代码生成 开发效率

5月18日,Cursor 正式发布 Composer 2.5,SWE-bench 测试成绩 79.8%,和 Opus 4.7(80.5%)、GPT-5.5(77.8%)站到了同一个梯队。更狠的是,每次任务平均成本不到 1 美元,而竞争对手完成同类任务可能要花 11 美元,把价格打到了对手的十分之一。
这是 Cursor 从「IDE 封装器」向「独立模型实验室」的身份转变。对开发者来说,这意味着两件事:更强的编码能力,更低的使用门槛。
这次更新值得关注点
性能不输顶级模型,成本只有1/10
SWE-bench Multilingual 是业界公认的软件工程能力测试基准。Composer 2.5 在这个测试中拿到了 79.8% 的分数,和头部模型几乎平手:
- Opus 4.7:80.5%
- Composer 2.5:79.8%
- GPT-5.5:77.8%
这个成绩说明什么?说明 Composer 2.5 已经具备了处理真实复杂软件工程任务的能力,不是玩具级别的代码补全。
更关键的是价格。对手完成一次类似任务可能要花 11 美元,Composer 2.5 不到 1 美元。十倍的成本差距,意味着你可以更大胆地用它来处理日常开发中的各种琐碎任务,而不必每次都权衡「值不值得」。
85%的算力砸在强化学习上
Cursor 团队把 85% 的计算预算都投在了后训练和强化学习上。他们引入了一种叫「带文本反馈的针对性 RL」的技术,让模型学会自我纠错。
具体来说,模型现在能识别并修正这些常见问题:
- 停止调用不存在的工具
- 在长达数百步的复杂任务中保持稳定
- 自动发现并修复逻辑错误
这种针对性的训练方式,比单纯堆数据更有效。它让模型在真实开发场景中表现得更像一个有经验的程序员,而不是一个只会照搬模板的初学者。
训练规模翻了25倍
相比上一代,Composer 2.5 用了多出 25 倍的合成强化学习任务进行训练。这些任务涵盖了很多复杂的场景,比如「功能删除与重建」这类需要多步骤推理的难题。
训练规模的提升直接反映在模型处理复杂任务的能力上。以前可能需要人工介入多次的任务,现在模型能更独立地完成。
Cursor 模型的进化速度有多快
过去三个月,Cursor 团队的迭代速度快得惊人:
| 时间 | 事件 |
|---|---|
| 2月9日 | Composer 1.5 发布 |
| 3月16日 | 启动 Composer 1 退役计划 |
| 3月19日 | Composer 2 上线,基于 Kimi K2.5 |
| 5月18日 | Composer 2.5 成为默认模型 |
从 1.5 到 2.5,不到四个月时间。这种迭代频率在传统软件公司里几乎不可能实现,但在 AI 领域正在成为常态。
更值得关注的是未来规划。Cursor 已经宣布和 SpaceXAI 合作,在 Colossus 2 集群上(百万块 H100 等效算力)从零训练一个规模大 10 倍的继任模型。这意味着下一代 Cursor 的能力可能会有质的飞跃。
定价策略变了,怎么用更划算
Composer 2.5 上线的同时,Cursor 调整了定价策略:
标准模式(Standard)
- 输入:$0.50/M token
- 输出:$2.50/M token
- 价格不变
快速模式(Fast)
- 输入:$3.00/M token(翻倍)
- 输出:$15.00/M token(翻倍)
快速模式价格翻了一倍,但换来的是更快的响应速度。如果你追求效率,这个模式仍然值得;如果更在意成本,标准模式性价比更高。
上线福利:发布首周,所有用户获得双倍用量。如果你想深度测试 Composer 2.5 的能力,现在是最好的时机。
技术细节:它为什么这么强
Composer 2.5 基于 Moonshot 的 Kimi K2.5 底座,但 Cursor 做了三层关键优化:
大规模合成数据:25 倍于前代的合成强化学习任务,覆盖更多复杂场景
Muon 优化器:实现 0.2 秒的优化步长,大幅提升训练效率
针对性强化学习:让模型学会自我纠错,在长任务中保持稳定
这三层优化的核心思路很清晰:不拼底座模型,拼后训练质量。Cursor 选择了一条和主流厂商不同的路——与其追逐更大的基础模型,不如把现有模型的后训练做到极致。
对普通开发者意味着什么
Composer 2.5 的发布,对不同类型的开发者有不同的意义:
如果你是一线开发者:现在可以用更低的成本,让 AI 帮你处理更多日常任务。代码审查、单元测试、文档生成这些琐碎工作,可以放心交给 Composer 2.5。
如果你是团队负责人:十倍的成本差距意味着你可以更大规模地部署 AI 辅助开发,而不必担心预算失控。这可能成为团队效率的一个新杠杆。
如果你在观望是否要用 AI 编程:现在的门槛已经足够低。Composer 2.5 的性能和价格组合,让它成为一个很难拒绝的选择。
当然,AI 不会取代程序员,但它会取代不用 AI 的程序员。这句话说了很多次,但现在它越来越接近现实。
一些建议
如果你还没用过 Cursor,或者还在用旧版本,建议趁这次双倍用量的机会,好好测试一下 Composer 2.5 的能力。重点关注这几个场景:
- 复杂功能的代码生成
- 多文件重构任务
- 单元测试编写
- 代码审查和优化建议
AI 编程助手已经从「偶尔能用」进化到了「日常必备」的阶段。
随着 SpaceXAI 合作的下一代模型正在训练中,我们有理由相信,AI 编码助手的未来会更加精彩。但更重要的是,现在的你已经可以开始享受这波红利了。
关注我,每天一个 AI 工具,帮你提升效率与认知。
如果你觉得这篇文章有用,欢迎转发给同事朋友,或者留言分享你的使用体验。