Back to News

CyberFactory and OpenAegis Train LLM Agents on Real-World Vulnerability Exploitation

#cybersecurity#llm-agents#vulnerability-exploitation#open-source-model

Researchers from Beihang University, ELLIS, SMU, and IQuest Research introduced CyberFactory, a pipeline that converts real-world vulnerability data into executable tasks for LLM agents, and trained the open-source model OpenAegis on the resulting trajectories. In a 1-hour evaluation, OpenAegis improved pass rate from 29.6% to 58.1% over the Qwen3.5 base, surpassing GLM 5.2 by 14.8 points and Kimi K2.7 by 6.4 points. The work addresses gaps in reproducible cybersecurity training pipelines, unified task solutions, and scalable agent data.

Coverage timeline

  1. 机器之心机器之心

    给一个大模型漏洞描述和代码仓库,它能否像安全研究人员一样,读代码、找入口、调用工具、构造输入,并反复验证自己的判断? 这已经不只是问答能力的问题。真正的网络安全任务往往要持续数十分钟甚至更久,模型需要在真实环境中完成搜索、编译、运行、分析和修正。决定成败的,不只是模型 “知道多少”,还包括它能否把一连串操作组织起来。 现有开源方案仍有几处彼此关联的缺口: 一些前沿模型虽然开放权重,却没有开源可复现的网络安全训练流程; 已有解决方案通常只解决单项任务,尚未形成统一方案; 已有解决方案缺乏可规模化的智能体数据; 规模化合成智能体数据需要安全相关的先验知识。 来自北京航空航天大学、欧洲学习与智能系统研究院(ELLIS)、新加坡管理大学(SMU)和至知创新研究院(IQuest Research)的研究团队提出了 CyberFactory ,并在此基础上训练出开源网络安全模型 OpenAegis 。这项工作的重点并不是再收集一批静态题目,而是补上从真实漏洞到智能体训练轨迹的整条链路。 CyberFactory 把公开世界中零散的漏洞材料重建为能运行、能判定的任务,再用一套安全分析 Skill 引导智能体完成任务、留下操作轨迹,最终把这些做事方法训练进OpenAegis。最终评测限时 1 小时。在这个条件下,与 Qwen3.5 基座相比,OpenAegis 的通过率从 29.6% 提升到 58.1%,领先 GLM 5.2 14.8 个百分点,领先 Kimi K2.7 6.4 个百分点。 论文标题:CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild Hugging Face: https://huggingface.co/collections/Multilingual-Multimodal-NLP/cyberfactory GitHub: https://github.com/CSJianYang/CyberFactory 两个关键突破:先造出轨迹,再让模型学会方法 这项工作围绕两个过去没有被同时解决的问题展开。 第一,真实漏洞资料并不等于训练数据。开源 CVE 记录通常只有漏洞说明、修复提交和少量崩溃信息。要让智能体真正动手解决问题,还需要补齐受影响的代码版本、修复后的版