Huawei, CUHK, HKUST release LegoFlow for automated code data engineering
Researchers from Huawei, CUHK, and HKUST introduced LegoFlow, an automated framework that streamlines code data engineering from repository collection to training and evaluation. They released LegoFlow-SWE with 5,000 tasks and 2,780 verified trajectories, and demonstrated recursive self-improvement: two iterations raised Qwen3.5-35B-A3B-Base's SWE-bench Verified score from 7.6% to 64.4%.
Coverage timeline
机器之心机器之心
从 1200 万个候选拉取请求中,最终留下 5000 个 SWE 代码任务 —— 不足 0.05%。把「出题、答题、改卷、训练、评测」这条代码数据流水线全自动跑起来,就是 LegoFlow; 在这个过程中,我们还发现了三个观察。 软件工程是最近大语言模型的核心能力,但高质量代码数据的生产仍相当复杂,涉及从仓库发现、任务验证、轨迹推理到训练评测的漫长流程。 如何把「造题、答题、筛选、训练、评测」这条代码数据流水线全自动跑起来? 华为、港中文、港科大的研究员们联合推出 LegoFlow ,一个简单易用、交互式的代码数据工程框架,亮点包括: 自动化智能体工作流 :从仓库和 PR 收集到任务验证、轨迹推理、训练与评测,每道流程都封装为标准插件技能,Claude Code、Codex 等编码智能体可直接调用。 开源任务与轨迹 :团队发布 LegoFlow-SWE,包含从 1,200 万个 PR 中筛选出的 5,000 个任务,覆盖 8 种编程语言和 20 个任务标签,以及 2,780 条验证成功的高质量轨迹;仅用 1,000 条轨迹训练 Qwen3.5-35B-A3B-Base,即可在 SWE-bench Verified 和 Pro 上分别达到 70.2% 和 48.8%。 迈向递归式自我改进 : 在极少人工设定下,智能体能运行完整流程、评估结果并调整策略。经过两轮迭代,Qwen3.5-35B-A3B-Base 在 SWE-bench Verified 上从 7.6% 提升至 64.4%。 项目博客:https://www.legox.net/blog/legoflow/ 开源数据:https://huggingface.co/datasets/Lego-X/LegoFlow-SWE 代码地址:https://github.com/LegoX/LegoFlow LegoFlow 如何工作 代码数据是训练推理型大模型的关键原料,但人工标注成本高、LLM 生成不可控、自动验证难度大,是社区公认的瓶颈。LegoFlow 将代码数据工程组织为一系列 block: Root 把用户目标转化为工作流并协调任务分发、资源与反馈; Curator 将仓库和拉取请求转化为经过验证的任务; Tracer 生成训练轨迹; Trainer 进行微调; Evaluator 返回基准评测结果。 每个
