[Cursor 技术报告] Composer 2:定义智能体软件工程的新高度

Composer 2 Technical Report

总结
问题
方法
结果
要点
摘要

本文介绍了 Composer 2,一种专为智能体软件工程(Agentic Software Engineering)设计的领域专用模型。该模型基于 Kimi K2.5 (1.04T MoE),通过持续预训练和大规模强化学习(RL)显著提升了长程规划和编码智能,在 CursorBench 上达到了 61.3% 的准确率,性能比肩 GPT-5.4 等顶流模型。

TL;DR

Cursor 团队发布了他们最新的旗舰模型 Composer 2。这不仅是一个编码助手,更是一个具备长程规划能力的“软件工程师代理”。通过对 1.04T 参数的 MoE 模型进行深度的持续预训练(Continued Pretraining)和大规模异步强化学习(RL),Composer 2 在解决真实世界复杂代码问题时,展现出了超越 GPT-5.2、直逼 GPT-5.4 的惊人实力,且推理成本更低。

1. 现状之痛:为什么通用模型在编码时“力不从心”?

尽管 GPT-4、Claude 3.5 等模型在简单的任务上表现卓越,但在真实的工程场景下经常“翻车”。Cursor 团队总结了四个核心痛点:

  • 领域失配 (Domain Mismatch):公开榜单(如 SWE-bench)偏重孤立的 Bug 修复,而现实中需要大规模重构。
  • 提示词过度规范 (Prompt Over-specification):实际开发中的需求往往是模糊的(Underspecified),模型需要具备极强的意图推断力。
  • 基准测试污染 (Data Contamination):公开 Repo 的代码经常进入训练集,导致由于记忆而非推理产生的虚高分数。
  • 评价维度单一:不仅要改对,还要代码优雅、运行快、交互体感好。

2. 核心架构:两阶段炼金术

Composer 2 的进化路径可归纳为:基座选择 -> 知识专业化 -> 策略强化。

持续预训练 (Continued Pretraining)

团队选择了 Kimi K2.5(1.04T 参数,32B 激活)作为基座。训练过程分为三个阶段,不仅将上下文长度从 32k 扩展到 256k,还引入了 Multi-Token Prediction (MTP) 层。这意味着模型在生成时能预测多个后续 Token,大幅提升了 Speculative Decoding 的推理速度。

强化学习 (Reinforcement Learning)

这是 Composer 2 能够产生“思考力”的关键。团队基于 GRPO 的变体,构建了一个完全异步的 RL 框架。

  • 环境对齐 (Environment Engineering):训练环境 Anyrun 与用户使用的 Cursor 端完全一致。
  • 异步训练与权重同步:为了减少 Off-policy 带来的不稳定性,系统实现了毫秒级的权重同步和 Router Replay(路由重放),确保推理端和训练端的 MoE 专家路径完全一致。

模型架构与训练逻辑说明 图:MoE 层中单个 Grouped GEMM 的训练流,通过 MXFP8 和 NVFP4 精度混合优化了训练效能。

3. 关键技术:自我总结与非线性惩罚

  • Self-Summarization (自我总结):对于超长任务,Composer 2 会在中间步骤进行自我摘要。这不仅节省了 KV Cache,还让模型学会了在有限的 Context Window 内处理更多的历史信息。
  • 非线性长度惩罚 (Nonlinear Length Penalty): 通过数学公式设计,团队让模型学会了“简单任务快刀斩乱麻,复杂任务深思熟虑”。 这种机制有效地抑制了模型产生废话,同时在必要时保留其“思维链(CoT)”。

4. 实验战绩:极致的 Pareto 特效

在团队自建的、最贴近现实的 CursorBench 上,Composer 2 的表现堪称惊艳:

  • 准确率:61.3%,远超老对手 Claude 4.5 和 GPT-5.2。
  • 成本优势:如下图所示,Composer 2 在性能与成本的平衡上(Pareto Frontier)几乎处于霸主地位。它的推理代价极低,但产出的结果却极高质量。

CursorBench 性能对比 图:Composer 2 在成本-准确率(Cost-Accuracy)坐标系中处于帕累托最优前沿。

5. 洞察与展望

Composer 2 的成功揭示了一个重要趋势:大模型的未来不仅仅是“大”,更是“精”。 通过专门的 RL 奖励设计(如代码风格奖惩、工具调用惩罚),我们可以训出比通用模型更懂编程、更有“码感”的智能体。

未来的研究方向将集中在更长时程的信号处理和更精细的基础设施支持。Cursor 团队坚信,我们正处于“软件第三纪元”的黎明,编码将从手工业演进为由智能代理驱动的高度自动化工程。


作者总结:如果你还在纠结通用的 GPT-4 能否写好你的业务逻辑,Composer 2 提供了一个清晰的回答——专门的事情,请交给专门配置、专门训练过的模型去做。

发现相似论文

试试这些示例

  • 查找最近其他针对软件工程智能体(Software Engineering Agents)应用强化学习(RL)技术的论文,尤其是关于如何解决长程策略梯度不稳定性的研究。
  • 哪篇论文最早提出了多标记预测(Multi-Token Prediction, MTP)用于加速推理?本文在Speculative Decoding中是如何结合这一技术的?
  • 有哪些研究详细探讨了 Mixture-of-Experts (MoE) 模型在强化学习阶段的训练稳定性问题,特别是关于 Router 权重漂移的解决方案?
目录
[Cursor 技术报告] Composer 2:定义智能体软件工程的新高度
1. TL;DR
2. 1. 现状之痛:为什么通用模型在编码时“力不从心”?
3. 2. 核心架构:两阶段炼金术
3.1. 持续预训练 (Continued Pretraining)
3.2. 强化学习 (Reinforcement Learning)
4. 3. 关键技术:自我总结与非线性惩罚
5. 4. 实验战绩:极致的 Pareto 特效
6. 5. 洞察与展望