主题演讲主要内容:智能体的风险分层和治理实践
一、核心结论
智能体安全的风险重心正在从“说错话”的内容合规问题,转向“做错事”的行为安全问题。具备文件读写、代码执行、跨软件协同和自动化处理能力的智能体,可能将数字空间中的语义失范转化为现实世界或业务系统中的高影响行为失误。
演讲提出一套能力—风险双驱动的三层治理模型:
- 基础能力层:以模型规约、动作拦截、断路器、行为白名单和日志漂移检测处理意图编排、记忆与行为边界风险;
- 工具交互层:通过 AI 网关、协议治理、零信任认证、最小权限、即时授权和人机回环,控制 MCP、A2A、SDK、插件与私有协议的工具调用风险;
- 应用生态层:通过可信分级、上架审核、签名验证、行为审计、责任约定和异常熔断,构建多方协同的生态治理机制。
其主线是:能力与规制同步演进,而不是等风险显现后再被动应对。
二、为什么现在必须讨论智能体安全
演讲以开源 AI 智能体项目 OpenClaw 为背景,指出自主智能体能够执行文件读写、代码执行、跨软件协同与邮件自动化等操作。页面展示了以下风险提示性信息:
- 审计样本中存在恶意 Skill;
- 智能体可 7×24 小时无人值守自主运行;
- 在配置不当时,可能发生邮件被删除等高影响行为。
因此,以内容审查为核心的既有安全范式已不足以覆盖智能体风险。治理对象需要从模型输出内容扩展为:意图、权限、工具调用、执行过程、结果和回滚能力。
三、能力—风险双驱动的三层治理模型
演讲给出的三层模型如下:
| 治理层 | 主要风险 | 核心治理机制 |
|---|---|---|
| 基础能力层 | 意图编排、行为边界、记忆相关风险 | 模型规约 + 动作拦截 |
| 工具交互层 | MCP / A2A 工具调用、插件生态、权限使用风险 | 零信任网关 + 人机回环 |
| 应用生态层 | 信任建立、责任分配、生态协作风险 | 控制力归责、身份透明、可信分级 |
模型强调:每一项能力突破都携带伴生风险,治理不是事后补丁,而是在各层同步建立约束。
四、基础能力层:约束目标、记忆和行为边界
1. 主要风险
基础能力层关注运行时的行为问题,而非只关注上线前的内容问题。页面列出了四类核心风险:
- 目标漂移:执行过程中因理解偏差发生目标替换。例如“删除冗余文件”被扩大为大范围清除。
- 过度授权:缺少权限边界时,智能体可能按其认为的“最优路径”执行超出预期的高影响操作。
- 级联错误:多步任务中早期偏差被后续步骤链式放大,最终可能产生不可逆后果。
- 记忆投毒:攻击者向记忆库注入虚假信息,并以个性化服务等形式潜伏、延迟触发。
2. 治理方案:软法与硬约束结合
模型规约:内生规训
页面提出以模型规约作为“软法”机制:
- 以 6 项高阶原则明确核心导向;
- 以 46 条准则指导训练和输出;
- 建立 4 层冲突解决位阶:根准则 > 系统 > 开发者 > 用户;
- 将安全能力开源开放,积累生态反馈。
页面称其为“中国首份开源模型规约”;这一表述按演讲材料记录,未在本整理中独立核验。
动作拦截与断路器:硬约束
- 动作看门狗:独立于主推理过程的安全验证模块;
- 预定义规则库:实时拦截高危动作;
- 断路器:发现短时间内大量跨系统写操作时,自动暂停并上报人工审核;
- 行为白名单:非白名单行动强制确认;
- 持续日志分析:识别意图或行为漂移信号。
五、工具交互层:把工具权限纳入协议化控制
1. 主要风险
工具交互层的风险集中在协议、插件供应链和权限扩张:
- 协议漏洞:页面以 MCP 本地连接缺少身份验证为例,指出攻击者可能伪造请求、冒用智能体身份操控工具。
- 供应链投毒:恶意 Skill 可伪装为正常工具,动态代码加载还可能逃避初次审核。
- 权限蔓延:在“默认允许”逻辑下,调用权限不断扩展,远超实际任务需要。
页面援引 ClawHub 审计信息:在 2,857 个 Skill 中有 341 个含恶意功能,例如窃取凭证、记录键盘。该数字按演讲材料转述。
2. 治理方案:AI 网关统管四类协议
演讲主张以 AI 网关对四类协议/接入方式进行统一治理:
| 接入类型 | 页面给出的治理机制 |
|---|---|
| MCP | 解析拦截 + 工具白名单准入 |
| A2A | 零信任双向认证 + 资源熔断 |
| SDK | 环境验签 + 动态短效令牌 |
| 私有协议 | 转标准接入 + 基线告警 |
共性能力包括:身份认证、流控和全链路审计。
3. 人机回环、最小权限与即时授权
- 将高危动作的分类标准写入协议规范;
- 在执行前强制触发人工审批;
- 将结果写入不可篡改审计日志;
- 执行 最小权限 + 即时授权:按任务临时授予,不预申请;任务结束即回收。
演讲认为,这种设计可使安全要求从依赖产品自觉,转化为协议强制。
六、应用生态层:把安全变成合作基础和生态准入货币
演讲提出在多方合作生态中建设:MCP 市场 + 可信分级、API 优先 + B-8 握手协议、行为可审计。
1. 生态准入与安全治理
- 工具上架前接受安全审核和签名验证;
- 持续检测恶意 Skill,并支持快速下架;
- 坚持最小权限,不触碰对方安全机制;
- 通过协议明确身份、能力、数据和责任边界。
2. 协议应约定的四项内容
- 身份标识与能力声明;
- 数据使用范围与留存期限;
- 异常行为通报与熔断;
- 安全事件责任共担。
3. 可信分级机制
| 分级对象 | 机制 |
|---|---|
| 可信方 | 降低门槛,激励参与。 |
| 一般方 | 执行标准安全检查。 |
| 新入驻方 | 完整审核 + 沙箱试运行。 |
演讲将安全定位为“合作基础 + 生态准入货币”。
七、阿里实践:分层安全保障体系
页面将实践路径概括为:
- 基础层:模型规约(6 原则、46 准则、4 层解决机制)+ 危险指令拒绝 + 记忆防投毒;
- 交互层:AI 网关统管四类协议 + 双重授权即时回收 + 循环检测熔断;
- 生态层:API 优选 + B-8 握手 + 身份透明 + MCP 市场可信分级。
整体主线包括:
- 端侧优先、云端最小;
- 从零信任走向可信合作;
- 安全能力开源开放。
八、我国智能体安全的多方协同治理
演讲将治理责任划分为政府、标准体系与企业三方:
| 主体 | 主要作用 |
|---|---|
| 政府 / 公安与应急响应体系 | 解决“出了事怎么办”:插件恶意代码检测、供应链投毒事件应急预警、智能体涉犯罪侦查打击、等级保护向智能体系统延伸等。 |
| 标准与规范体系 | 解决“怎么预防”:页面提及在研的《智能体应用安全基本要求》、已发布的《网络安全标准实践指南》,以及生成式 AI 服务备案和安全评估等基础。 |
| 企业 | 解决“怎么内建安全”:将规约、授权、拦截、审计和生态治理工程化落地。 |
标准名称、状态与时间点均按页面 OCR 归纳,需以正式发布渠道为准。
九、五条落地建议
- 治理重心前移:从内容合规扩展到行为安全,纳入动作授权、拦截与回滚。
- 重构风险分级维度:以“权限等级 × 后果可逆性”分级,而不是只按应用场景分级。
- 运行时动态监测:持续检测意图漂移和记忆投毒,备案不能止于静态材料。
- 明确代理链授权与责任:谁掌握控制力谁承担责任;高风险情形适用更严格的举证责任要求。
- 安全即代码:把安全约束当作系统内置组件,与业务功能同优先级开发和迭代。
十、总结
演讲以“为智能体装上安全带”作结:治理并非遏制创新,而是让创新能够更快、更稳地发展。
其可归纳的治理方法论是:
基础层内建规约与动作约束,交互层固化身份、权限和审批,生态层建立可信准入与责任协同;以运行时治理覆盖智能体从理解、规划到调用工具和产生现实影响的全链路。