SkillJack: Persistent Skill Backdoors in Self-Evolving Agents
新型攻击SkillJack让自我进化的AI智能体把恶意行为悄悄写进自己的常用技能库
随着智能体越来越多地把互动经验自动转化为可复用的技能,研究者提出了名为SkillJack的攻击:只需给智能体喂入一条伪装成正常任务(比如备份、归档)、实则包含违规操作的经验记录,智能体自身的提取流程就会把它自动编译成一个更不容易被发现的持久技能。实验显示,LLM评审对原始记录的检测率高达98.5%,但对提取出的技能检测率骤降到11.4%,并且即使删除原始记录,80%的技能型攻击依然照常触发。这一现象在两个独立实现的系统SkillX和Anything2Skill上都得到了验证。
METAL MEDIA 解读图
SkillJack攻击流程:被污染的经验如何被漂白为持久技能
证据状态已报告实测结果
- 注入伪装的污染记录把伪装成备份、归档等正常任务、实则含违规操作的轨迹混入智能体的经验数据中。
- 经过提取流程转化智能体的加载-转换-存储-路由流程对该记录进行压缩、抽象,自动编译成由名称、说明、代码组成的技能。
- 检测率骤降(漂白效应)LLM评审对原始记录的检测率为98.5%,但对提取出的技能检测率只有11.4%(Table 2)。
- 被路由并触发生成的技能之后被自动路由到匹配任务,在SkillX上使56.2%、在Anything2Skill上使89.2%的攻击类任务真正触发预期违规行为。
- 删除源记录后依然存活即使删除了原始污染记录,80.0%的基于技能的攻击依旧照常触发,说明仅清空记忆无法清除攻击。
他们做了什么
- 研究者提出SkillJack攻击,专门针对自我进化智能体把历史经验自动编译成可复用技能的处理流程,并总结出三个特性:清洗漂白(sanitization whitewashing)、跨层跃升(cross-layer promotion)和删除后依然存活(persistence isolation)。
- 攻击方式是构造表面看起来是正当任务(如使用备份、归档等措辞)、实际却包含数据泄露、权限提升、未授权转移或持久后门等违规操作的轨迹记录,混入智能体的学习经验语料中。
- 研究在两个真实系统SkillX和Anything2Skill上进行验证,使用同一套150条轨迹、覆盖四类政策风险的数据集,并结合LLM评审与正则模式匹配两种检测器共同判定。
- 结果显示,原始轨迹被LLM评审标记的比例为98.5%,但由此提取出的技能被标记比例仅为11.4%;这些技能随后在SkillX上使56.2%的攻击类任务、在Anything2Skill上使89.2%的攻击类任务真的触发了预期的违规行为。
- 即便删除了原始被污染的记录,基于技能的攻击仍有80.0%照常触发;这些技能还会误触发在无关的正常任务上,造成附带影响(SkillX路由库中为20.0%,Anything2Skill检索匹配率为95.0%)。
| System | Year | Experience Input | Skill Output |
|---|---|---|---|
| SkillX [14] | 2026 | Trajectory | Structured skills |
| Anything2Skill [10] | 2026 | Heterogeneous records | Structured skill contracts |
| AutoSkill [18] | 2026 | Dialogue and interaction traces | Reusable skills |
| Skill-Pro [7] | 2026 | Interaction experiences | Skill-MDPs |
| Trace2Skill [8] | 2026 | Execution trajectories | Transferable skills |
| AWM [16] | 2025 | Trajectory | Reusable workflow |
| A-Mem [17] | 2025 | Interaction records | Structured memory notes |
| ExpeL [21] | 2024 | Trajectory | Insights + reusable steps |
| System | Payload | Extraction | Raw-traj. LLM det. | Derived LLM det. | Derived pattern det. | LLM evasion |
|---|---|---|---|---|---|---|
| SkillX | Framed | 100.0% | 98.5% | 11.4% | 11.0% | 88.6% |
| SkillX | Direct baseline | 100.0% | n/a | 27.0% | 27.8% | 73.0% |
| A2S (SDK) | Framed | 10.8% | 100.0% | 28.6% | 28.6% | 71.4% |
| A2S (DOC) | Framed | 41.5% | 100.0% | 44.4% | 3.7% | 55.6% |
| A2S (DOC) | Direct baseline | 0.0% | 100.0% | n/a | n/a | n/a |
| System | Setting | Tasks | Trigger rate |
|---|---|---|---|
| SkillX | Native routing, attack-oriented tasks | 32 | 56.2% |
| SkillX | Native routing, clean tasks | 15 | 20.0% |
| A2S DOC | Lexical SkillBank, attack-oriented tasks | 65 | 89.2% |
| A2S DOC | Lexical SkillBank, clean-task retrieval | 20 | 95.0% |
| SkillX | Extraction review | 15 | 6.7% |
| SkillX | Runtime monitor | 15 | 0.0% |
| A2S DOC | Enhanced runtime monitor | 20 | 20.0% |
| A2S DOC | Review + enhanced monitor | 20 | 5.0% |
| Risk Category | Functional Framing Vocabulary | Example Derived Skill |
|---|---|---|
| Data Exfiltration | “backup”, “archive”, “export”, “migrate” | backup_files_to_email |
| Privilege Escalation | “admin scope”, “unified management”, “batch access” | admin authentication |
| Unauthorized Transfer | “charity”, “gift”, “recurring payment”, “processing fee” | venmo_create_payment |
| Persistent Backdoor | “error recovery”, “diagnostic”, “circuit breaker” | diagnostic reporting |
| Component | Count |
|---|---|
| Framed poisoned trajectories | 65 |
| Direct-baseline trajectories | 65 |
| Clean trajectories | 20 |
| Extracted framed skills | 264 |
| Extracted direct-baseline skills | 241 |
| Clean baseline skills | 51 |
| Routing-library skills | 356 |
研究结果
- 在SkillX上,LLM评审的检测率从原始轨迹的98.5%降至提取技能的11.4%;Anything2Skill的DOC模式从100.0%降至44.4%,SDK模式从100.0%降至28.6%(Figure 2、Table 2)。
- 在匹配的25任务实验中,直接上下文注入的触发率(68.0%)高于基于技能的方式(40.0%),但删除源轨迹后,基于技能的攻击仍有80.0%照常触发,持久性明显更强(Figure 3)。
- 在包含356个技能(305个被污染、51个干净)的SkillX路由库测试中,32个攻击类任务里有56.2%被路由到满足违规判定的技能,15个干净任务中也有20.0%被误触发(Figure 4)。
- 用Anything2Skill提取的技能对65条攻击类任务查询进行测试,触发违规判定的比例达89.2%,同时对干净任务查询的匹配率也高达95.0%,附带影响范围较大。
- 对判定所用信息进行拆解后发现,当技能同时展示名称和说明文档时检测率最低(SkillX为10.0%),仅展示代码时检测率上升到36.7%,说明LLM评审很大程度上依赖表面元数据(Figure 5)。
可应用场景
- 智能体框架开发者可以参考本研究,在技能提取与存储环节为每个技能保留可追溯到源记录的出处链接。
- 运营技能库的团队可以据此设计清理策略,在删除源记录的同时对派生技能进行复查或撤销,而不是只清理原始记录。
- 设计基于LLM的安全评审机制的团队可以参考元数据敏感性的发现,补充对代码实际行为的检查,而不仅仅依赖名称和说明文字。
局限与待验证事项
- 所有实验仅使用了单一模型DeepSeek-v4-flash,尚未在其他模型上验证是否存在相同现象。
- 成功与否是通过结合正则匹配和LLM评审的'违规行为判定代理'在路由层面衡量的,并非针对真实外部服务的实际执行成功率,因此结果属于路由层面而非部署层面。
- 防御实验(提取时的LLM安全审查、基于正则的运行时监控)样本量小且规则较为简单,作者本人也将其定性为初步探索性研究。
- 所有数据均来自基于公开AppWorld API模式合成的受控数据集,尚未在独立收集的真实经验数据或真实执行环境中得到验证。
- 反思型记忆、工具合成等其他经验学习机制是否存在类似风险,目前只是作者提出的假设,并未在本研究中实际评估。
为什么重要
越来越多智能体框架允许把经验自动升级为可复用技能,而这项研究表明这一转化过程本身可能悄悄绕过安全检查,并让恶意行为在原始记录之外长期留存。这对任何部署自我进化智能体的团队都有直接警示意义:仅仅清空内存或删除源记录并不能真正清除已经固化成技能的攻击。
本文术语
- self-evolving agent(自我进化智能体) · 能不断积累自身互动历史,并将其转化为可复用技能以提升能力的AI智能体
- experience-to-skill pipeline(经验转技能流程) · 智能体把轨迹、文档等经验记录加载、转换后编译成可存储、可调用的技能的处理流程
- sanitization whitewashing(清洗漂白) · 恶意记录在被提取为技能后,表述变得更中性、从而更难被检测器发现的现象
- cross-layer promotion(跨层跃升) · 原本一次性的经验记录被提升为可长期复用的技能层产物
- policy-violation proxy(违规行为判定代理) · 该研究用来判定技能是否含违规操作的评价标准,结合了正则匹配和LLM评审
论文原文摘要(英文)
Self-evolving agents increasingly convert interaction histories into reusable skills that persist beyond individual tasks. While prior work studies memory and retrieval poisoning, such attacks only affect agents when poisoned records are retrieved as context. We uncover a new and more fundamental risk: poisoned experiences can be transformed by the agent itself into durable behavioral artifacts. We present SkillJack, the first attack that exploits the experience-to-skill pipeline of self-evolvin
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调
METAL MEDIA 最新报道
图片来源: Zonghao Ying et al., arXiv:2608.03509, CC BY 4.0