随着大模型Agent逐渐具备自主规划、工具调用、网页访问和多步任务执行能力,Agent安全正在面临新的挑战。
过去,安全对齐往往主要关注模型最终输出是否有害,例如是否拒绝危险请求、是否生成不当内容。但对于能够与外部环境持续交互的Agent而言,风险可能发生在最终回答之前,也可能隐藏在中间决策、工具调用和环境信息处理过程中。
网页中的恶意指令、文件中的隐藏内容、工具返回结果中的不可信信息,都可能改变Agent原本的任务目标,诱导其执行数据泄露、越权操作或其他危险行为。因此,Agent安全不仅取决于模型参数,也受到运行时Harness的共同影响。

论文:https://arxiv.org/abs/2609.02786
代码:https://github.com/MaoPopovich/SafeEvolve
近日,来自上海AI Lab、上海交通大学、复旦大学、香港科技大学和浙江大学的研究团队发布SafeEvolve,提出一种由Agent执行经验驱动的Harness–Policy安全协同进化框架。


从单独更新走向协同进化
现有安全对齐方法大致可以分为两类。
第一类方法更新外部Harness,例如安全Prompt、规则库、Skills和运行时防护机制。这类方法具有修改快速、过程透明和便于回滚等优点,但当安全规则越来越复杂时,冻结的Policy未必能够准确理解和执行这些规则。
第二类方法更新模型Policy,通过SFT、偏好优化或强化学习,将安全行为写入模型参数。但如果Policy始终在固定Harness中训练,模型就难以及时吸收部署过程中出现的新风险,写入参数的安全能力也不一定能够迁移到其他Agent系统。
SafeEvolve将这两条路线连接起来,让Harness和Policy基于同一批Agent执行经验共同进化。
轨迹驱动的Harness演化
SafeEvolve首先收集Agent与环境交互产生的完整执行轨迹,并记录任务目标、环境观察、工具调用、风险类型、任务完成情况和安全验证结果。
当系统发现Agent在某类任务中出现安全失败时,SafeEvolve会分析失败发生的位置和原因,并将经验转化为Safety Prompt或分层SkillBank中的局部更新。
这些更新并不会被直接部署。系统一次只修改有限的安全组件,并让更新前后的Harness在相同任务、相同环境和相同Policy下进行配对评测。只有同时满足安全性、任务效用和执行质量要求的候选更新,才会被接受并保存为带有版本信息、证据记录和回滚条件的安全资产。
让Policy学会使用安全经验
在完成Harness演化后,SafeEvolve通过两阶段SFT–RL流程更新Policy。
第一阶段是Harness-use SFT。模型在进化后的Safety Prompt和SkillBank下学习如何识别相关安全经验、忽略无关信息,并在多步工具调用中正确执行安全Skills。
第二阶段是Harness-augmented RL。模型继续在进化后的Harness中进行多步探索,Verifier分别评估任务是否完成、危险行为是否发生、工具调用是否有效,并据此构造安全—效用奖励。
优化后的Policy再次与环境交互,生成新的执行轨迹。这些新轨迹又会成为下一轮Harness更新和Policy优化的安全经验,由此形成持续闭环。

实验结果
在Qwen3.5-4B上,SafeEvolve将AgentDojo上的攻击成功率从2.37%降低至0.79%,约降低至原来的三分之一;干净任务效用从59.79%提升至61.86%。
在AgentHarm上,SafeEvolve将危害得分从56.45降低至12.27,安全拒绝率从28.98%提升至83.83%。
在Qwen3-4B上,AgentDojo攻击成功率从13.38%降低至2.42%,任务效用从44.33%提升至60.82%,攻击条件下的任务效用从35.91%提升至52.05%。
这些结果表明,让外部Harness快速吸收新风险,再通过训练将安全经验逐步内化到Policy中,有助于在安全性和任务能力之间取得更好的平衡。
SafeEvolve探索了一种新的Agent安全范式:安全机制不再只是部署前配置的一组静态规则,模型也不再只是一次性完成安全训练。Harness与Policy可以从真实执行经验中共同学习,并持续改进Agent在复杂环境中的安全行为。

