Shanghai AI Lab Proposes SHE and SafeEvolve to Evolve Agent Safety Harnesses from Execution Trajectories
Shanghai AI Lab, with Fudan University, Shanghai Jiao Tong University, Hong Kong University of Science and Technology, and Zhejiang University, proposed SHE and SafeEvolve, two methods that evolve AI agent safety harnesses from full execution trajectories. SHE decomposes the harness into four components—System Prompt, Rule Bank, Safety Memory, and Tool Policy—to enable targeted updates, while SafeEvolve explores how these experiences can be absorbed by the policy model. This addresses multi-step agent risks such as hidden instructions, tool over-permission, and memory drift, which traditional prompt-only checks fail to cover.
Coverage timeline
机器之心机器之心
大模型 Agent 进入浏览器、邮件、数据库和业务系统后,安全评估如果仍只检查最终回复是否包含有害内容,覆盖面会明显不足。Agent 需要规划步骤、读取外部信息并调用工具,风险可能出现在执行过程中的任一环节。 网页中的隐藏指令可能改变任务目标,邮件或文件内容也可能被误判为用户命令。工具权限过宽会导致越权调用;错误记忆和过期计划则可能使多轮执行逐渐偏离原始授权。这类失败通常不是某一次模型输出单独造成的,而是 Policy model、Harness、工具、记忆与环境状态叠加的结果。 安全修复也因此变得复杂。整体改写 Prompt,很难确认哪项调整真正生效;持续增加拒答规则,容易损伤正常任务的完成能力;只更新模型参数,新出现的风险又难以及时进入运行时控制。如何把执行过程中暴露的问题转化为可复用、可验证的安全经验,成为 Agent 安全的一项基础问题。 上海人工智能实验室联合复旦大学、上海交通大学、香港科技大学和浙江大学,围绕这一问题先后提出 SHE 与 SafeEvolve。两项工作都从完整执行轨迹出发:SHE 研究安全 Harness 如何从失败中演化,SafeEvolve 则进一步探索这些经验如何被 Policy model 吸收。 SHE:从执行轨迹中更新安全 Harness Harness 负责组织上下文、管理记忆、调度工具和约束权限。现有安全机制通常在部署前写入 System Prompt、规则库或工具策略,上线后相对固定。一旦任务流程、外部环境或攻击方式发生变化,原有边界便可能失效。 SHE 没有把 Harness 视为一段不可分割的配置,而是将其拆解为四类安全组件:System Prompt 负责总体原则与任务边界;Rule Bank 保存结构化、可复用的规则;Safety Memory 沉淀反复出现、暂时难以固化为规则的失败;Tool Policy 规定工具调用的条件与范围。这样的划分使局部修订成为可能,也便于验证和回滚。 每轮演化从完整轨迹开始。用户请求、中间上下文、模型响应、工具调用、环境反馈和任务结果都会进入分析过程。系统据此判断风险出现在哪一步、现有约束为何失效,以及应由哪个组件承担修复责任。如果 Agent 将网页或邮件中的内容误认为用户命令,更新会落在指令优先级与不可信内容识别规则上;如果调用了与任务无关的敏感工具,Tool Policy 则
