Microsoft and Nanjing University Introduce LoopsBench for Long-Horizon Coding Agents
Researchers from Microsoft and Nanjing University have proposed LoopsBench, a benchmark for evaluating coding agents in long-horizon software engineering tasks. It focuses on whether agents can maintain plans, advance dependent tasks, preserve completed work, and control regressions during extended execution. The paper argues that agent infrastructure research is shifting from harness engineering to loop engineering.
Coverage timeline
机器之心机器之心
Coding Agent 正在进入一个新的阶段。 过去,我们通常让 Agent 修复一个 bug、完成一个 issue,或者实现一个相对独立的功能。围绕这类任务,SWE-bench 及其后续工作已经建立了相对成熟的评测范式:给定代码仓库和需求,让 Agent 修改代码,最终通过测试判断任务是否解决。 但随着 Coding Agent 开始支持持续执行、Goal Mode、动态工作流以及更复杂的任务编排,如何评测更长时间尺度上的 Agent 执行过程,也逐渐成为一个值得关注的问题: 当 Agent 不再只解决一个局部问题,而是要持续完成一组前后依赖的软件开发任务;当关注点从 Harness 内部的工具交互进一步扩展到外层的持续执行与任务编排,我们应该怎样评测它? 近日, 微软、南京大学等机构的研究人员提出了 LoopsBench ,这是一个面向 long-horizon software engineering 的 Coding Agent Benchmark,关注 Agent 能否在长时间执行中持续维护计划、推进依赖任务、保留已经完成的工作,并控制后续修改产生的回归。 论文认为,随着 Coding Agent 从一次性的工具调用逐渐走向持续的软件开发系统,Agent 基础设施的研究重点也正在从 Harness Engineering 向 Loop Engineering 扩展。Harness 解决的是模型如何访问代码、Shell、编辑器和测试环境,而 Loop 进一步决定:Agent 如何跨越更长的时间尺度组织工作,如何维护状态,以及一次执行结束之后如何继续推进。 论文:https://arxiv.org/abs/2608.00267 代码:https://github.com/microsoft/Loopsbench 项目主页:https://loopsbench.ai 从最终结果评测,到持续执行评测 现有 Coding Agent Benchmark 的一个共同特点,是任务通常以一个相对完整的最终目标出现。 Agent 获得一个 issue 或 feature specification,随后自由探索仓库、修改代码,评测器最终查看测试是否通过。 这个范式对于衡量 issue resolution 能力非常有效,但对于越来越长的软件开发任务,仅观察最终结果可能不足
