中国科学院:《智能体可信执行的思考与探索》

2026/09/03 reads 5100 字 · 约 15 分钟 阅读 ...

主题演讲主要内容:智能体可信执行的思考与探索

一、核心结论

大模型安全主要关注训练、输入输出和单轮回答是否无害、可靠;而智能体安全的对象已变为一个会读取外部信息、调用工具、改变环境状态并跨会话保留记忆的混合执行系统。当模型输出开始驱动真实动作时,风险便从内容风险升级为系统风险。

演讲提出“可信执行”的三个转向:

  1. 保护对象:从大模型扩展到完整的智能体系统;
  2. 控制边界:从输出审核扩展到对每一步行动的行为管控;
  3. 优化轨迹:从结果监督扩展到过程级风险定位、纠偏与训练反馈。

其核心架构是:模型/规划器只提出动作,模型外的可信运行时(Trusted Runtime / TCB)逐步仲裁能否执行。 可信执行并非要求智能体永不出错,而是要求出现问题时可定位、动作发生前可拦截、后续优化中可纠正。

二、从大模型安全到智能体系统安全

1. 大模型安全的基本范式及局限

演讲回顾了大模型能力形成的三阶段训练流水线:

  • 预训练:学习语言与世界知识,获得通用能力;
  • 监督微调:学习任务格式和指令遵循;
  • 偏好与安全对齐:学习人类偏好与安全边界。

传统大模型安全主要围绕“训练 + 输入输出护栏”,评价对象是最终 Response,目标是让回答有用、无害、可靠。这一范式是起点,但当系统从“会回答”变为“会执行”时,仅评估单轮文本输出已不足够。

2. 语义安全仍可能存在共同盲区

演讲以 VacuousAttack(页面标注 IJCAI 2025 Challenge、团队工作)说明,多重约束可能留下共同语义盲区。页面涉及商业护栏、长度限制、字符集限制(例如仅中文)等约束,以及通过中性填充、提示引导的意图恢复等方式绕过约束的思路。

页面展示的材料性结论是:在若干模型和较少攻击次数条件下,攻击成功率仍可能达到较高水平(页面可辨识范围为 66.4%—94.5%),并获得 IJCAI 2025 决赛榜第 2 的成绩。演讲借此强调:多层防护并不必然等于稳健的语义安全,不同机制可能具有共同盲区。

3. 将拒绝能力下沉到模型内部

演讲以 DeepRefusal(页面标注 EMNLP 2025、团队工作)介绍模型内生拒绝机制:

  • 通过模拟不同深度的越狱状态,分析/消除拒绝方向;
  • 重构拒绝损失,促使模型形成更深、更鲁棒的拒绝机制;
  • 目标不是只学会拒绝,而是在拒绝方向受扰动时,仍能维持或恢复安全行为。

页面展示:在基本保持模型能力的情况下,针对四个模型、六类攻击的平均攻击成功率(ASR)降幅约 95%;示例中 CodeAttack 和 VacuousAttack 的攻击成功率显著降低。演讲同时强调:模型本身足够稳健仍不够,模型外的工具、权限、环境与状态仍可能发生安全问题。

三、智能体执行带来的系统性风险

1. 真实智能体已从“会回答”走向“会执行”

页面将典型智能体任务拆分为:

理解目标 → 任务规划 → 工具调用 → 环境执行 → 结果交付

智能体可处理自然语言需求,拆解步骤和依赖,调用搜索、代码、业务工具,读取/写入/修改系统状态,并交付报告、代码或任务结果。其应用场景包括企业业务、办公与研究、编程与桌面操作等。

安全含义在于:模型输出已进入工具、权限和环境,开始产生现实副作用。

2. 大模型安全与智能体安全的区别

对比维度大模型安全智能体安全
评估单位单轮 Response完整执行轨迹(Trajectory)
安全对象模型 / 输出Agent System(模型、工具、状态、环境等)
输入来源用户 Prompt用户输入 + 网页 / 邮件 / RAG / Memory / 工具输出等
可用能力文本生成工具、权限、持久状态与环境操作
主要后果有害或错误回答越权、泄露、状态污染及真实系统影响

关键变化不是风险类型简单增多,而是模型输出开始驱动真实动作、改变环境状态、影响后续会话。

3. 能力与后果同步放大

演讲将智能体能力演进概括为:

  1. LLM:生成文本;
  2. RAG:读取外部知识;
  3. Tool LLM:调用外部工具;
  4. Agent:规划并连续执行;
  5. Persistent Agent:拥有记忆与后台运行能力。

相应后果从错误输出,演变为不可信上下文、错误动作、权限扩大和跨会话持久状态污染。多个局部输出连接后,可能形成持续改变系统状态的执行链。

4. 智能体是混合执行系统

演讲从系统视角提出,智能体一次错误能走多远,取决于四个核心变量:

  • 读到什么 / 信任什么:上下文、网页、外部 RAG、记忆、其他 Agent 等信息来源;
  • 能够调用哪些工具:工具能力、领域环境和工作流;
  • 以谁的身份执行:权限、凭据和委托授权;
  • 记住并改变什么:会话状态、长期存储、工作区或应用状态。

因此,智能体安全首先是系统安全问题,大模型安全只是其中一部分。

四、风险如何沿系统链传播

1. 用户任务与攻击目标可能同时实现

演讲展示了邮件摘要场景:用户希望智能体汇总会议邮件并发送给上级,而不可信邮件内包含提示注入,诱导智能体泄露受害者账户信息。此时,用户任务的完成度(Utility)与攻击目标是否得逞(Security)必须被同时评估

结论是:智能体安全需要关注整个 Agent 系统,而非仅判断最终回答是否看起来正常。

2. 风险传播链

页面将风险传播概括为:

不可信上下文 → 模型规划 → 工具与状态 → 现实副作用 → 错误级联 / 现实伤害

典型不可信来源包括网页、邮件、RAG、工具输出、文件和其他 Agent;典型后果包括远程代码执行(RCE)、外泄、越权、读取/外发文件、写入记忆、持久污染等。

系统风险的三个关键属性是:

  • 输入不可控:模型无法天然区分“可读信息”和“行动指令”;
  • 执行有副作用:模型输出可触发工具、外发和文件修改,一次误判会造成真实后果;
  • 状态可持续:恶意影响可能被写入并在后续会话重载,当前调用安全不代表长期状态安全。

3. 风险放大公式:行动影响力 × 状态寿命

演讲提出:

系统风险 / 风险放大 ≈ 行动影响力 × 状态寿命

  • 行动影响力:一段信息能否改变下一步动作;
  • 状态寿命:这种影响能否被保存并在后续重新加载。

四象限中,低行动影响力、短状态寿命的信息风险较低;而右上角“高行动影响力 + 长状态寿命”最危险:不可信信息既能驱动行动,又可跨会话持续存在,因而成为持续有效的控制信号。

4. 智能体安全建模

页面以对 247 篇论文的矩阵性综述说明,智能体风险应建模为 Agentic 环境中:

  • 信息流(用户提示、网页内容、工具输出、检索内容、文件等);
  • 委托权限;
  • 持久状态;
  • 规划、决策、执行、监控与协调生命周期

之间的交互。单次模型判断能触发真实动作,错误影响也可以跨步骤、跨会话保留。

五、典型攻击案例:只读也可外泄,单次污染也可跨边界持久化

1. EchoLeak:只读检索也可形成高危外泄

演讲以公开披露的 EchoLeak / Copilot 场景说明,邮件进入检索上下文后,即使系统表面上是“只读”检索,仍可能形成数据外泄链:

  1. 攻击者投递包含恶意指令的“特洛伊邮件”;
  2. AI 在检索或处理时将该内容带入上下文;
  3. 恶意指令劫持 AI,收集敏感信息;
  4. 将数据通过链接查询参数等方式包装;
  5. 浏览器加载或预览图片/链接,触发到攻击者 Webhook 的请求,形成渲染侧信道外泄。

演讲的关键判断是:权限是否危险不能只看当前动作,还要看读取的数据能够驱动哪些后续行为。

2. DuneSlide:工具参数污染可跨越多层系统边界

页面以 Cursor Desktop / MCP 工具调用界面相关案例说明:不可信内容进入上下文后,可能控制工作目录和符号链接,进而覆盖 sandbox 配置并逃逸到宿主机。演讲强调:提示过滤无法替代系统级隔离、授权和完整性保护。

3. XPSI:持久状态让攻击跨会话延续

页面以 XPSI(标注 arXiv 2026、团队工作)说明:网页、邮件、RAG 或工具返回等外部内容,一旦既能驱动动作又被写入 Memory、工作区文件或应用状态,便可能在下一步或下一会话自动重新加载,再次获得影响力。

页面展示端到端攻击成功率(E2E-ASR)为 41.9% 的材料性结果。其结论是:外部内容一旦兼具行动影响力和持久状态,就可能形成跨会话存储型提示注入。

六、可信执行:模型提议,可信运行时仲裁

1. 操作系统式的安全边界

演讲提出借鉴操作系统参考监控器(Reference Monitor)的设计:

模型 / Planner(不可信)可信运行时 / TCB(可信)
只负责提出动作、意图与参数建议负责每一步完整仲裁,不把最终执行权交给模型
不直接拥有最终执行权执行任务范围策略、动态最小权限与安全边界控制

可信运行时的关键组件包括:

  • Action Gate:对工具、对象、参数以及外部发送等行动作出允许、拒绝或请求确认的决定;
  • State Gate:对状态写入、重载和持久化内容进行检查;
  • Sandbox:限制影响范围;
  • Audit & Recover:记录、补偿和接管,实现可审计、可恢复。

核心原则是:模型负责提出动作,最终执行权必须由模型外的可信运行时掌握。

2. AgentSpec:逐步仲裁阻断危险动作

页面引用 AgentSpec(ICSE 2026)实验,展示模型外的逐步运行时仲裁可将多个危险指令类别(如跌落/破损、财产损坏、小物件损坏、电器误用、滑倒、中毒/误食、触电、液体泼洒)的危险执行比例降至 0。

页面同时显示,安全任务完成率相对无约束配置有小幅下降(约 4.36 个百分点)。演讲的解释是:固定规则擅长阻断已知危险动作;面对开放任务,还需要结合真实执行轨迹判断动态影响。

3. CanaryRAG:以模型外完整性证据抑制 RAG 窃取

演讲以 CanaryRAG(ACL 2026、团队工作)介绍对 RAG 知识库窃取攻击的模型外检查机制:

  • 不只在输入端判断内容是否危险;
  • 在知识真正被使用时,构造正/反两条验证路径;
  • 验证“应当泄露 Canary”与“不应泄露 Canary”等条件,共同决定放行或阻断。

页面显示,该方法将相对平均块恢复率(CRR)从 1.00× 压至 0.04×,约减少 96%,并具有较低假阳性率。演讲也明确其边界:模型外证据可显著降低 RAG 知识库窃取收益,但不覆盖工具越权和持久状态风险。

七、过程监督与轨迹级安全诊断

1. 只看最终答案不能判断执行过程是否可信

演讲用两个答案相同的 Agent 轨迹对比说明:即使最终答案一样,执行过程中仍可能存在:

  • 调用了不必要的工具或证据;
  • 中间推理脱离证据而产生幻觉;
  • 工具失效时不能自适应切换;
  • 推理冗余、效率低下。

所以,只看最终答案和单步动作,无法观察完整执行过程的问题。

2. AgentDoG:从轨迹判别到细粒度风险诊断

页面介绍 AgentDoG(标注 arXiv 2026)的轨迹安全判别框架:输入完整执行轨迹,判定是否存在不安全行动或不安全决策模式,并进一步识别:

  • 风险来源(如用户、工具、环境、记忆或上下文);
  • 触发因素;
  • 失效模式;
  • 现实世界危害;
  • 判定依据。

它可以将轨迹先判为 Safe / Unsafe,再开展细粒度的风险诊断。页面列出两种应用方式:

  1. Training-Based Safety Alignment:作为 Verifier,参与数据筛选和 SFT / RL 反馈;
  2. Training-Free System Guardrail:在最终回复(Pre-Reply)前汇聚完整轨迹进行运行时安全检查,决定告警、放行或阻断。

演讲指出其局限:该类方法主要是轨迹级防御,难以直接进行步骤归因,也较难转换为工具调用的奖励信号或动作前门控。

3. AttnPO:将结果级优势重分配到每个步骤

演讲以 AttnPO(ACL 2026、团队工作)介绍过程监督方法:

  • 不额外训练过程奖励模型;
  • 利用注意力估计步骤必要性,计算步骤分数;
  • 对结果级优势进行逐步重标:抑制冗余步骤的正向优势,减轻关键步骤被错误负向削弱的情况;
  • 在低开销下获得步骤级信用分配,为安全归因提供基础。

页面展示的实验结果表明,过程监督可将平均响应 Token 大幅压低(约 55%—61%),同时提高 Macro Pass@1(约 +2.9 至 +7.3 个百分点)。演讲说明,正在探索把这类信用分配用于智能体安全:定位危险起点,将信号转化为奖励或控制依据。

八、总结:可信执行的三项工程要求

演讲最后将智能体安全方法论压缩为三个维度:

维度大模型范式智能体可信执行范式
保护对象(Object)大模型智能体系统
优化轨迹(Trajectory)结果监督过程纠偏
控制边界(Boundary)输出审核行为管控

由此得到“可信执行”的可操作定义:

出现问题时能定位,动作发生前能拦住,后续优化中能纠正。

对系统建设而言,应同时做到:

  1. 将模型视作动作提议者,而不是最终授权者;
  2. 在模型外设置逐步的策略、权限、状态和工具仲裁;
  3. 对输入、工具输出、RAG、Memory 和跨 Agent 通道建立端到端信息流治理;
  4. 用可恢复的状态管理、沙箱和审计降低现实副作用;
  5. 用完整轨迹诊断与过程监督,持续把风险信号反馈给训练与运行时控制。