Cognition发布SWE-2编程模型:首次在多万亿参数规模完成强化学习训练

AI 画家正在创作中

AI编程公司Cognition于9月10日正式发布SWE-2编码模型,在FrontierCode1.1 Main基准测试上达到50.0%得分,与Fable5.1的50.9%仅差一个百分点,同时推理成本低64%。这款模型基于Kimi K3(2.8万亿参数)进行后训练,在DeepSWE1.1基准上取得73.0%,超越Grok4.6的67.5%和Fable5.1的67.4%,并在Terminal-Bench2.1上达到92.8%的最高得分。

多万亿参数强化学习的首次突破

SWE-2的核心技术突破在于首次将强化学习扩展到多万亿参数规模。训练基础设施沿用SWE-1.72的RL框架,关键创新是一种单一训练运行中同时训练所有推理努力等级的算法。这一设计源于帕累托前沿的第一性原理推导:对每个努力等级施加与其局部斜率相匹配的线性成本惩罚,既能推进整个成本性能前沿,又能保留原有前沿形状。

与GPT-5.6 Sol相比,SWE-2在FrontierCode1.1 Main上得分50.0%对47.5%,成本仅为四分之一;在DeepSWE1.1上两者基本持平(73.0%对72.7%),SWE-2的成本优势同样接近4比1。对比GPT-6 Astra(FrontierCode53.3%),SWE-2落后三个百分点,但成本低75%,为预算敏感的企业用户提供了接近顶级的编程能力选择。

训练方法的关键细节

SWE-2在奖励基线设计上采用长度加权方式,该方法从SWE-1.6起沿用,被证明能显著稳定训练过程。在推理服务层面,团队训练了在线草稿模型来提升解码吞吐量,并采用NVFP4和FP8核以及量化感知训练,使SWE-2在使用近三倍参数量的基座模型情况下,内存占用和训练推理不匹配度均低于SWE-1.7。Terminal-Bench这一更贴近真实软件工程场景的基准测试上,SWE-2取得了27.3%的得分,对比Kimi K3基座模型的21.5%和Grok4.6的20.3%,展现出大规模强化学习在复杂工具使用场景中的显著增益。Terminal-Bench4的更难变体上,SWE-2得分同样领先所有同规模模型,仅次于GPT-6 Astra。

训练数据方面,RL环境数量扩展到三倍,加入了指令遵从叠加层,并构建了一个以前序SWE-2检查点为驱动的迭代飞轮,用于持续加固验证器。SWE-2于发布日起在Devin Desktop和CLI中可用,用户可直接选择该模型执行编程任务,无需额外配置或等待列表。

对编程代理市场的意义

Cognition通过SWE-2展示了一条清晰的技术路线:在超大规模基座模型上进行针对性强化学习后训练,能以远低于顶级模型的成本逼近其性能水平。这直接冲击了"能力与成本必须正相关"的行业定价逻辑。随着更多团队开始在生产环境部署编程代理,这种成本效率比将成为采购决策中的关键变量。

从行业竞争格局看,SWE-2的发布标志着编程专用模型正式进入与通用前沿模型直接竞争的阶段。Kimi K3作为基座模型的选择也表明,非美国AI实验室的开源或半开源模型正在成为闭源训练管线的重要构件。Cognition计划公开FrontierCode排行榜数据以促进透明度,这可能推动行业在编程代理能力评估上形成更统一的标准。