国家超级计算天津中心:《AI 变革带来的网络安全破坏性挑战与应对》

2026/09/03 reads 3684 字 · 约 11 分钟 阅读 ...

主题演讲主要内容:AI 变革带来的网络安全破坏性挑战与应对

一、核心结论

AI 的快速演进正在将网络安全风险从“工具辅助型”推向更强的自动化、隐蔽化与自适应攻击。大模型与智能体可明显压缩攻击开发和漏洞利用周期,使攻击链的构建、执行与迭代能力增强;与此同时,超算系统既是 AI 创新的关键算力底座,也是高价值、复杂异构的安全运维对象。

演讲提出的应对路径可概括为三层:

  1. 以智能化安全运维守护超算底座:将异构多源数据、异常检测、根因分析、知识库与多智能体协作结合,形成“感知—研判—执行—验证—复盘”的安全自治闭环。
  2. 建设 AI 安全攻防训练基地:汇聚算力、模型、数据、算法、靶场、平台与人才,开展安全大模型、安全智能体、红蓝对抗与实战化测评训练。
  3. 形成全栈 AI+安全体系:安全不应只盯住基础设施或模型,而应覆盖硬件/算力、模型基座、数据与 API 链路,以及上层 Agent 应用,构建纵深防御闭环。

二、演讲内容梳理

1. AI 变革及其安全影响

  • 演讲先回顾人工智能从早期 AI、机器学习、深度学习到生成式 AI / 大模型阶段的发展脉络。
  • 页面以全球标志性模型数量等图表说明 AI 模型能力和产业竞争的快速发展;页面文字引用的图表信息显示,美国与中国均在前沿模型发布中占据重要位置。
  • AI 已不再只是效率工具,而正在成为可影响安全攻防节奏的“破坏性创新”变量。

2. AI 带来的网络安全破坏性挑战

页面强调:AI 已能够辅助、甚至在一定范围内独立完成复杂攻击链中的漏洞利用开发等环节,从而大幅压缩攻击开发周期。

主要风险特征包括:

  • 攻击自动化:攻击者可借助 AI 提升漏洞挖掘、攻击代码生成、攻击链编排等工作的效率。
  • 攻击隐蔽化与自适应:AI 驱动的攻击可以更快调整策略,增加检测与响应难度。
  • 攻防博弈升级:传统以规则、人工分析和静态边界为主的防护方式面临更强压力。
  • AI 自身安全风险:页面列举了漏洞挖掘、数据投毒、深度伪造、反向诱导、供应链攻击、提示词注入、思维链劫持、越狱攻击等方向。
  • 开发工具与供应链风险:页面援引“工信部 NVDB 平台提示 Claude Code 安全后门隐患”的案例性文字,意在提示 AI 编程工具、模型/插件与软件供应链需纳入安全治理。

3. 超级计算:驱动 AI 创新的算力引擎

  • 超级计算机被定位为电子信息技术发展的基础驱动,是全球科技竞争的重要制高点之一。
  • 超算系统需要同时突破性能、访存、通信、能耗与可靠性等“墙”,并兼顾实用性能、可编程性、可移植性、系统鲁棒性和经济可行性。
  • 从传统 CPU 计算到 CPU+GPU 等异构架构,超级计算为高性能计算、深度学习与大模型创新提供了关键基础。
  • 因超算集群规模大、异构性强、资源价值高,安全运营不仅是外围防护问题,更关系到算力系统的持续、可靠和可信运行。

4. 超算传统网络安全基础设施

演讲展示了超算安全运营的既有基础能力:

  • 一体化全机监控:实时监测运行时指标和安全事件日志,支持秒级根因分析。
  • 资产与配置统一纳管:通过配置管理数据库等方式,关联变更、故障、工单与 IT 资产,构建业务关联知识图谱。
  • 可视化与告警治理:统一告警、可靠性与安全监控、海量数据可视化、变更审计,以及万级设备纳管。
  • 纵深防御与分区隔离:涉及租户/业务分区隔离、主机安全、高速网络、用户行为分析、流量监控、蜜罐、漏洞扫描、态势感知、WAF、堡垒机、日志审计、数据库审计、防火墙、抗 DDoS 与零信任等控制措施。

5. 面向超算系统的智能安全运维

目标是实现面向 E 级超算算力系统的智能化、安全自治与可靠运行。其关键技术路线包括:

  • 异构多源、跨维数据联动整合:整合日志、指标、配置、告警、命令/API/Web 等多类数据和操作接口。
  • 异常检测与根因分析:从多类异常中识别问题,定位故障和安全事件根因,并支撑运维诊断。
  • 系统状态驱动的多智能体协作:以多个专业 Agent 分工协作,连接工具、知识库和执行接口。
  • 全链路自治闭环:实现高精度决策、任务执行、结果验证及持续改进;同时保持工具生态和场景扩展能力。

多源数据异常检测与故障注入

  • 支持灵活、可控、脚本化的故障注入,以持续迭代异常检测、根因定位和运维诊断能力。
  • 通过多集群/多节点日志与指标自动采集,结合知识库、因果分析、异常检测模型与根因排序,完成诊断和验证。
  • 在处置后自动恢复环境,沉淀数据样本,形成可训练、可验证、可回归的闭环。

多智能体安全事件自动处理

页面给出的典型流程可概括为:

  1. 任务拆解 / 意图识别:接收用户请求、监控告警等输入,识别事件及处置目标。
  2. 安全事件自动处理:生成结构化响应方案和任务计划,调用脚本、API、Shell 等工具执行处置,例如恶意 IP 封禁。
  3. 结果检查 / 回环验证:结合规则、白名单/黑名单等机制复核结果,避免误报或越权处置。
  4. 记录 / 复盘:保留日志和处置结果,写入知识库或经验库,生成报告并持续优化。

页面主张该模式可显著缩短相对传统人工运维的响应时间,但照片中用于支撑具体性能对比的小字指标无法可靠识别,因此未转述具体数值。

多智能体运维自身的安全保障

演讲特别指出:赋予 Agent 感知、规划和执行能力后,Agent 本身必须受控。页面以 Harness Engineering 为关键词,强调通过约束、观测、审计与人工参与保障自治运维安全。

可辨认的安全控制包括:

  • 在超算集群多节点上搭建 沙箱,作为 Agent 的“安全试验场”;
  • 对资源和网络进行双重隔离,将故障影响限定在最小范围;
  • 对未授权操作进行拦截,对越权访问直接阻断;
  • 保持全程可审计、可回滚;
  • 引入 Human-in-the-Loop(人工在环),在关键操作中保留人工确认与干预能力。

6. 构建一体化 AI 安全攻防训练基地

演讲提出建设“算力—模型—数据—算法—靶场—平台—人才”一体化 AI 安全攻防训练基地。

建设目标

  • 打造训练与推演平台,筑牢信创攻防基础设施;
  • 强化安全基座大模型能力,构建多模态安全知识库;
  • 突破协同对抗的多智能体安全技术;
  • 建设对抗性安全专项测评靶场;
  • 建设人才培养和标准管控体系;
  • 依托国家科技力量与京津冀产业优势开展协同建设。

实施基础

页面展示了基地应具备的资源基础,主要包括:

  • 算力与存储:国产超算与智算基础设施、云计算和大数据环境;
  • 安全数据集:安全日志、公开数据集、网络流量、威胁情报、漏洞、恶意样本、产品/测试数据与报告等;
  • 智能运维与合规能力:支持数据治理、跨域数据访问及安全合规运维;
  • 合作资源:与科研机构、高校、企业等合作单位形成攻防场景、数据和评测支撑。

照片中部分数据集规模和设备参数模糊,未在本整理中引用具体数值。

研究内容与技术体系

基地拟输出安全大模型、安全智能体、AI 攻防靶场等系列安全服务与基础设施,面向高性能计算、工业仿真、电力网络、金融服务、物联网、生物医药、农业生产等场景提供支撑。

主要研究方向包括:

  • 安全数据治理、多智能体知识库与日志关联分析;
  • 集群运维监控与安全模型敏捷开发;
  • 系统实战化安全测评训练平台;
  • 智能体攻防推演、智能渗透测试、文件篡改攻击判定、调度与多模型裁决等技术;
  • 大规模 AI 对抗样本生成、对抗样本库与持续靶场资源池;
  • 威胁情报/舆情监测、文件异动监测、流量检测与攻击路径预测、攻击链溯源;
  • 大语言模型、漏洞代码识别模型、攻击意图研判模型、安全事件摘要模型、恶意流量分类模型等安全模型能力。

红蓝多智能体攻防模拟

  • 页面展示了基于 DefenderBench 的红蓝多智能体攻防系统架构,并提及 CyberBattleSim 环境。
  • 设计核心是将“策略推理”与“具体动作执行”解耦:红方规划/执行、蓝方分析/执行分别协同;动作受到约束和验证,并通过失败记忆机制提高过程可控性。
  • 示例描述红方通过 RDP 连接并控制 Windows 节点,蓝方在同轮扫描检测该节点并执行 reimage(重置/重建)处置,呈现持续红蓝交互与状态演化。
  • 实验关注“成功到达目标攻击”与“预算内未完成攻击”等长程现象,并强调完整过程记录和决策轨迹分析能力。

7. 超算 AI+安全方案展望

演讲最后提出全栈安全观:

  • 基础设施可信化,为前端应用提供底层安全,并实现服务器与算力环境可信度量;
  • 部署超算安全智能运维系统,守护基础设施与数据链路;
  • 构建 AI 安全攻防训练基地,提升模型、系统和智能体的攻防与测评能力;
  • 覆盖业务终端与前端应用、API 通信、智能体应用、模型基座、数据链路与基础设施等层次。

其核心表述是:安全不能只聚焦基础设施或大模型本身,必须建立全栈视角,覆盖从硬件基础设施到模型基座、数据接口,再到上层 Agent 智能体应用的完整链条,形成纵深防御闭环。

三、对安全治理的启示

  1. 将 AI 视为攻防能力放大器:治理重点需从单点模型安全扩展到 AI 赋能攻击后的完整攻击链风险。
  2. 以数据和可观测性支撑自治:没有统一资产、日志、指标、告警、变更和知识库,智能体很难安全可靠地执行运维任务。
  3. 自治必须与约束并行:Agent 的权限最小化、沙箱隔离、工具调用控制、审计回滚与人工在环是安全自治的前提。
  4. 从单系统防护走向攻防训练与验证:通过靶场、红蓝对抗、故障注入、仿真环境和失败记忆机制,把安全能力转化为持续可验证的工程能力。
  5. 建设贯穿底座到应用的全栈体系:基础设施、模型、数据、API、工具和 Agent 应用必须纳入统一风险视角,避免治理断层。