[ArXiv 2026] SlopCodeBench:揭露编程智能体在迭代中的“架构崩塌”

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

总结
问题
方法
结果
要点
摘要

本文推出了 SlopCodeBench,这是首个衡量编程智能体(Coding Agents)在长程迭代任务中性能衰减的基准测试。该基准包含 20 个跨语言问题和 93 个检查点,重点评估智能体在自行扩展代码时产生的“代码质量腐败”现象。实验显示,即便最强的 Claude Opus 4.6,其完整任务成功率也仅为 17.2%。

TL;DR

软件工程并非一锤子买卖,而是不断的迭代与修补。然而,当前的 AI 编程智能体(Coding Agents)在面对长线开发时表现出了惊人的“质量腐败”。最新论文《SlopCodeBench》通过 93 个连续的任务关卡证明:随着代码轮次的增加,AI 会陷入一种被称为 “Slop” 的泥潭——代码越来越臃肿,逻辑越来越混乱,最终导致开发陷入停滞。

核心痛点:为什么 Pass Rate 是个“骗局”?

在 HumanEval 或 SWE-bench 等传统基准上,我们习惯于关注 Pass Rate(通过率)。但作者指出:通过测试不代表代码质量好

想象一个场景:智能体在第一轮用硬编码(Hardcoding)解决了需求,测试绿了。但在第二轮需求变更时,由于第一轮的烂代码(Bad Design),智能体不得不打更多的“补丁”。最终,代码库变成了难以维护的“巨形函数(God Functions)”。这种由于早期设计决策导致的后期维护灾难,在现有的单次生成评测中是完全隐形的。

方法论:捕捉代码的“腐败”

为了量化这种“烂代码”的积累过程,SlopCodeBench 引入了两个关键维度:

  1. 结构侵蚀 (Structural Erosion): 公式定义为:。 它捕捉的是复杂度是否过度集中。AI 倾向于在一个函数里不断叠加 if-else,而不是进行合理的模块化解耦。

  2. 冗余度 (Verbosity): 基于 AST-Grep 的静态规则检测冗余模式(如无效的 try-catch 或重复的参数解析)。

模型架构与评测流程 图 1:SlopCodeBench 的评测闭环:智能体必须继承自己上一轮的“代码遗产”。

实验发现:全线崩溃的智能体

研究者测试了包括 Claude 4.6 和 GPT-5 系列在内的 11 款顶尖模型,结论令人沮丧:

  • 无人通关:没有任何一个智能体能从头到尾完成所有检查点。
  • 成本激增,质量下降:随着任务推进,推理成本(Token 消耗)增加了 2.9 倍,但结构侵蚀率在 80% 的案例中持续攀升。
  • 人机差距巨大:研究对比了 48 个高质量人类开源项目。人类代码的质量曲线随时间趋于平缓,而 AI 代码则呈现直线上升的退化(见图 4)。

实验结果对比 图 4:人类代码(Human)与智能体代码(Agent)随迭代次数增加的侵蚀度对比。

深度洞察:Prompt 救不了“设计纪律”

作者尝试了两种干预策略:

  • Anti-Slop:在指令中明确禁止冗余模式。
  • Plan-First:要求先写设计文档再写代码。

结果显示(如图 5 所示):Prompt 的干预确实改善了代码的起始质量,但这仅仅是移动了直线的“截距”。斜率(退化速度)依然没变。这意味着智能体在骨子里缺乏处理复杂架构演进的能力,一旦进入代码继承阶段,即便有再好的规划,它们仍会不由自主地回到“堆砌模式”。

Prompt干预实验 图 5:不同 Prompt 策略下的质量变化趋势,斜率近乎平行。

结论与展望

SlopCodeBench 开启了一个残酷的新视角:我们不仅要看 AI 能不能写代码,还要看它写的代码能不能活到明天。

对于开发者和研究者来说,这篇论文是一个警钟。如果未来的 AI Agent 想要真正替代程序员进行生产级开发,它们必须学会人类的“设计纪律(Design Discipline)”——即在编写今天的代码时,为明天的扩展预留空间。

局限性:目前该基准主要针对 Python。虽然设计上是语言无关的,但不同语言的 Idiomatic Patterns 可能对侵蚀度指标有不同的敏感度。

发现相似论文

试试这些示例

  • 查找最近其他关于 LLM 编程智能体在多轮迭代(Iterative Coding)中一致性和代码衰退问题的研究论文。
  • 哪篇论文最早引入了“结构侵蚀(Structural Erosion)”或相关软件老化(Software Aging)的定量评估方法,本文是如何将其适配到 AI 生成代码场景的?
  • 是否有研究通过强化学习(RL)或自我博弈(Self-play)来训练编程智能体,使其具备长期的软件架构设计规划能力?
目录
[ArXiv 2026] SlopCodeBench:揭露编程智能体在迭代中的“架构崩塌”
1. TL;DR
2. 核心痛点:为什么 Pass Rate 是个“骗局”?
3. 方法论:捕捉代码的“腐败”
4. 实验发现:全线崩溃的智能体
5. 深度洞察:Prompt 救不了“设计纪律”
6. 结论与展望