SWE Refactor Bench: Top Coding Agents Fail Long-Horizon Stack Migrations
Einsia AI's Navers Lab released SWE Refactor Bench, a benchmark testing coding agents on whole-repository stack migrations across 20 real open-source projects totaling 867,000 lines of code and 10,594 files. Tasks include language rewrites (e.g., C to Rust) and framework migrations, with top models' pass rates dropping sharply compared to bounded repair tasks like SWE-bench Verified.
Coverage timeline
机器之心机器之心
从 SWE-bench Verified 到 SWE Pro,再到 DeepSWE,模型们已经把这套题目快刷到头了 —— 修复 bug、实现功能,这些 “ bounded repair ” 任务,当前的大模型已经做得足够好,好到可以放心让它们无人值守地跑。 但真正的软件工程,从来不只是修 bug。 DeepSWE 已经撕开了一道口子 —— 当考题从 “改几行代码” 变成跨文件长任务改写,顶级模型通过率从 96% 跌至 70%。 但 DeepSWE 仍然不是终点。 对 Coding Agents 的终极考验不是本地编辑,而是整个代码库的演进。 把一套 20 万行的系统,从 C 语言整个重写成 Rust,接口不变、行为不变、旧代码全部删掉 —— 这才是工程师日历上真正填满的工作。 而这件事,AI 还远远做不到。 比 DeepSWE 更残酷的 “地狱级” 新基准 Einsia AI 旗下 Navers Lab 最近放出了一个新基准 —— SWE Refactor Bench ,该项目在 X 发布后获得了 50 万次浏览,并引起了海外社区 3000 多个相关讨论。 论文题目:SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration? 项目主页:https://lab.einsia.ai/swe-refactor-bench Arxiv:https://arxiv.org/abs/2608.23564 Github repo:https://github.com/Einsia/SWE-Refactor-Bench 如果说 DeepSWE 考的是 “在现有代码库里实现一个新功能”,那 SWE Refactor Bench 考的是 “ 重建 ”。 20 个真实开源项目,包括 SQLite、zlib、libsodium、GraphHopper 这些工业级基础设施,总共 86.7 万行代码、10,594 个文件 。 任务分为四类: 语言重写(7 个) :C→Rust、C→Java、Python→Go、JavaScript→Rust…… 框架迁移(7 个) :Flask→Starlette、Express
