Back to News

Huawei, CUHK, HKUST release LegoFlow for automated code data engineering

#code-data-engineering#llm-training#recursive-self-improvement#swe-bench

Researchers from Huawei, CUHK, and HKUST introduced LegoFlow, an automated framework that streamlines code data engineering from repository collection to training and evaluation. They released LegoFlow-SWE with 5,000 tasks and 2,780 verified trajectories, and demonstrated recursive self-improvement: two iterations raised Qwen3.5-35B-A3B-Base's SWE-bench Verified score from 7.6% to 64.4%.

Coverage timeline

  1. 机器之心机器之心

    从 1200 万个候选拉取请求中,最终留下 5000 个 SWE 代码任务 —— 不足 0.05%。把「出题、答题、改卷、训练、评测」这条代码数据流水线全自动跑起来,就是 LegoFlow; 在这个过程中,我们还发现了三个观察。 软件工程是最近大语言模型的核心能力,但高质量代码数据的生产仍相当复杂,涉及从仓库发现、任务验证、轨迹推理到训练评测的漫长流程。 如何把「造题、答题、筛选、训练、评测」这条代码数据流水线全自动跑起来? 华为、港中文、港科大的研究员们联合推出 LegoFlow ,一个简单易用、交互式的代码数据工程框架,亮点包括: 自动化智能体工作流 :从仓库和 PR 收集到任务验证、轨迹推理、训练与评测,每道流程都封装为标准插件技能,Claude Code、Codex 等编码智能体可直接调用。 开源任务与轨迹 :团队发布 LegoFlow-SWE,包含从 1,200 万个 PR 中筛选出的 5,000 个任务,覆盖 8 种编程语言和 20 个任务标签,以及 2,780 条验证成功的高质量轨迹;仅用 1,000 条轨迹训练 Qwen3.5-35B-A3B-Base,即可在 SWE-bench Verified 和 Pro 上分别达到 70.2% 和 48.8%。 迈向递归式自我改进 : 在极少人工设定下,智能体能运行完整流程、评估结果并调整策略。经过两轮迭代,Qwen3.5-35B-A3B-Base 在 SWE-bench Verified 上从 7.6% 提升至 64.4%。 项目博客:https://www.legox.net/blog/legoflow/ 开源数据:https://huggingface.co/datasets/Lego-X/LegoFlow-SWE 代码地址:https://github.com/LegoX/LegoFlow LegoFlow 如何工作 代码数据是训练推理型大模型的关键原料,但人工标注成本高、LLM 生成不可控、自动验证难度大,是社区公认的瓶颈。LegoFlow 将代码数据工程组织为一系列 block: Root 把用户目标转化为工作流并协调任务分发、资源与反馈; Curator 将仓库和拉取请求转化为经过验证的任务; Tracer 生成训练轨迹; Trainer 进行微调; Evaluator 返回基准评测结果。 每个