ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

【学习笔记】主流 AI 安全防护框架研究报告

2026/8/6 14:43:10 拓冰建站 浏览量
【学习笔记】主流 AI 安全防护框架研究报告

一、摘要

生成式 AI 与智能体(Agent)的规模化落地,使传统以"边界防御+漏洞管理"为核心的网络安全体系在 AI 场景下出现系统性盲区。

本报告将主流框架归纳为五类角色,并给出可落地的统一防护架构。

关键发现 1:

框架已从"单一清单"走向"分层组合"

没有任何单一框架能覆盖治理、技术控制、威胁对抗与合规全部维度。成熟组织普遍采用NIST AI RMF(治理)+ISO 42001(管理体系)+OWASP LLM Top 10(应用层风险)+MITRE ATLAS(红队/威胁)的组合范式。

关键发现 2:

2025 年风险版图被 Agent 与 RAG 重写

OWASP LLM Top 102025 版相对 2023 版重构:新增系统提示泄露、向量/嵌入弱点,将"过度代理(Excessive Agency)"提前,并以无界资源消耗取代"模型窃取",直接呼应 Agent 与多模型部署的安全现实。

关键发现 3:

合规时钟已经开始走动

EU AI Act 自2025-02起分阶段生效,GPAI 义务已于 2025-08 落地,高风险与既有模型全面合规期限延伸至2027-08。所有受监管行业(制造、医疗、政务、能源等)须把"合规即控制"前置到架构设计阶段。

核心结论:AI 安全不是"再买一套安全产品",而是建立"治理—风险—控制—对抗—合规"五位一体的工程化能力。本报告第 7 章给出的分层参考架构与第 11 章的四阶段路线图,可作为各类组织从 0 到 1 建设的通用基线模板。

二、研究背景与范围

AI 系统相较于传统软件,引入了三类本质性新风险面,这正是传统安全框架"够不着"的地方:

  • 非确定性(Non-determinism):相同输入可能产生不同输出,难以用传统单元测试覆盖,需要"概率性保障"与持续监控。

  • 数据驱动脆弱性:训练数据投毒、成员推断、模型逆向可在"无漏洞"的情况下泄露敏感信息。

  • 工具调用与自主性:Agent 通过插件/函数调用接入真实系统,攻击面从"提示词"延伸到"操作权限",过度代理成为高危风险。

本报告聚焦"已发布、可操作、被行业广泛引用"的框架,按角色而非按发布方组织内容,便于读者按需取用。

纳入标准

权威机构发布、具备可执行指引、有真实落地案例或被监管引用。

时间范围

覆盖 2023–2026 已发布版本,重点纳入 2025–2026 更新。

视角

以建设方/运营方( defend )为主,兼顾监管方与红队方视角。

行业适配

面向全行业通用;互联网、医疗、政务、制造、零售、教育等均适用,按风险等级取用。

三、AI 安全框架分类体系

将 12 个主流框架按"在 AI 安全生命周期中扮演的角色"划分为五类。读懂这张图,就理解了"为什么需要组合使用"。

图 1 AI 安全框架五角色分类体系(基于发布方角色与能力取向归纳)

监管合规

定义"必须做",具法律约束力,强制风险分级与评估。

风险管理

提供"如何想",结构化识别、度量与处置 AI 风险。

安全设计

给出"如何建",将安全控制嵌入 AI 工程链路。

威胁对抗

模拟"如何攻",以攻击者视角暴露系统与战术。

负责任/可信

锚定"为何做",以公平、透明、隐私等价值底线。

四、核心框架深度解读

以下对 6 个最具代表性的框架做深度拆解,其余框架在第 4.7 节概览。

4.1 NIST AI Risk Management Framework (AI RMF 1.0)

发布方:美国国家标准与技术研究院(NIST)|版本:1.0(2023-01 发布,2024 起配套 Generative AI Profile)|性质:自愿性、风险导向、行业中立。

AI RMF 以四个核心职能(Functions)组织 AI 风险管理活动,治理(Govern)为横切职能贯穿始终,之上叠加可信 AI 八大特征。

图 2 NIST AI RMF 四职能模型与可信 AI 特征

落地要点:AI RMF 不直接给控制项,而是给"思考框架"。建议将其与 ISO 42001 的条款结构对齐——Govern≈条款 5(领导)/4(环境),Map/Measure/Manage≈条款 6–10(策划/支持/运行/评价/改进),形成"战略+执行"的治理闭环。

4.2 OWASP Top 10 for LLM Applications(2025 版)

发布方:OWASP 社区|版本:2025 Edition v2.0(2025-05 发布)|性质:应用层安全风险清单,面向开发/安全/红队。

2025 版相对 2023 版做了结构性重构,以适配 Agentic AI 与多模型/RAG 部署:将"过度代理"提前、新增"系统提示泄露"与"向量/嵌入弱点"、以"无界资源消耗"取代"模型窃取"。下表自上而下按攻击面聚合呈现。

2023 → 2025 关键变化:① 敏感信息泄露由第 6 升至第 2;② 过度代理由第 8 升至第 6 并成为 Agent 头号风险;③ 移除"模型拒绝服务/插件设计/模型窃取"单独条目,转化为"无界资源消耗"与"系统提示泄露/向量弱点"等新形态;④ 明确覆盖多模型与 Agentic 部署。

4.3 MITRE ATLAS(Adversarial Threat Landscape for AI Systems)

发布方:MITRE|版本:v5.4.0(2026-02 更新)|性质:对抗性威胁知识库(TTP),类 ATT&CK 风格,STIX 2.1 机器可读。

ATLAS 当前包含16 个战术(Tactics)、84 个技术(Techniques)、56 个子技术、32 个缓解措施、42 个真实案例。其价值在于把"AI 攻击"从零散漏洞上升为可编排的攻击链,直接服务于红队、SOC 检测规则与威胁狩猎。

图 3 MITRE ATLAS 战术链(对抗性杀伤链视角)

红队用法:将 ATLAS 技术映射到检测规则。例如AML.T0051 提示注入→ 在输入网关部署注入特征检测;AML.T0020 投毒训练数据→ 对训练集做来源与统计异常校验;AML.T0048 从 RAG 收集→ 限制检索范围并监控外泄。42 个真实案例(如 iProov 深度伪造、SesameOp 后门)可直接用于 Purple Team 演练。

4.4 ISO/IEC 42001 与 23894 / 38507

发布方:ISO/IEC JTC 1/SC 42|版本:ISO/IEC 42001:2023(AI 管理体系 AIMS)、ISO/IEC 23894:2023(AI 风险管理指南)、ISO/IEC 38507:2022(AI 使用的治理含义)。

ISO/IEC 42001 是首个可认证的 AI 管理体系标准,采用高阶结构(HLS)与 Annex A 控制措施,可与 ISO 27001 一体化审核。其条款 4–10 构成 PDCA 闭环。

图 4 ISO/IEC 42001 的 PDCA 闭环与 SC 42 标准族关系

SC 42 标准族构成互补矩阵:38507解决"组织如何使用 AI 的治理含义"(董事会/管理层视角),23894给出风险管理方法论,42001将其落地为可认证管理体系,5338定义 AI 生命周期,TR 5469处理 AI 功能安全。受监管行业客户常将 42001 与 27001 合并建设,形成"信息安全 + AI 安全"双体系。

4.5 Google Secure AI Framework(SAIF)

发布方:Google|版本:2024 发布,持续更新|性质:工程化安全控制框架,含风险地图(Risk Map)与 15 项重点风险/控制。

SAIF 的核心主张是:把过去 20 年积累的基础设施安全能力扩展到 AI 生态,并以自动化对抗对抗。其六大核心要素如下。

要素 1

扩展安全基础到 AI 生态

将既有安全基础设施(身份、密钥、网络隔离)覆盖到训练/推理/数据链路。

要素 2

将检测响应延伸至 AI

把 AI 系统纳入组织威胁宇宙,统一 SIEM/SOC 检测与事件响应。

要素 3

自动化防御

以自动化跟上已知与新生威胁,包括对抗性训练与红队自动化。

要素 4

平台级控制统一

在平台层而非逐应用实现一致安全,降低碎片化。

要素 5

自适应控制

根据反馈快速调整缓解措施,形成部署闭环。

要素 6

业务情境化风险

将 AI 系统风险置于 surrounding 业务流程中评估,而非孤立看模型。

风险地图(Risk Map):SAIF 以"数据源 → 训练管线 → 模型/服务"三段式识别 15 项重点风险,例如数据源投毒、训练管线权限滥用、推理端点提示注入、模型抽取等。其落地抓手是"以基础设施安全承载 AI 安全",对已有成熟安全中台的大型机构尤为友好。

4.6 EU AI Act(Regulation 2024/1689)

发布方:欧盟|性质:具有法律约束力的横向 AI 法规,全球首个全面 AI 立法。

采用风险分级思路:不可接受风险(禁止)、高风险(强合规义务)、有限风险(透明性义务)、最小风险(自愿)。其合规时钟已启动。

图 5 EU AI Act 四级风险金字塔

合规时间线(关键节点)

2025-02-02禁止性实践 + AI 素养义务生效社会评分、操纵性 AI 等被禁;供应商须履行 AI 素养培训。

2025-08-02通用目的 AI(GPAI)义务生效第 51–56 条 GPAI 模型义务、AI 办公室与成员国主管机关开始运作。

2026-08-02高风险系统主要义务生效多数高风险 AI 系统的合规、评估、登记与监督义务落地(含过渡期安排)。

2027-08-02既有模型全面合规2025 年前投放市场的 GPAI/高风险系统的完全合规期限。

对各类组织的含义:招聘筛选、医疗诊断辅助、关键基础设施调度、内容审核、教育评测等被明确列为高风险场景,须满足风险管理、数据治理、技术文档、人类监督、可追溯与事件通报等义务。EU AI Act 与 ISO 42001 / NIST AI RMF 高度互补——可用后者作为前者的"合格评定"证据基础。无论是否受欧盟管辖,其高强度要求都可作为全球 AI 治理的对标上限。

4.7 其他重要框架概览

框架

发布方

定位

关键产出

Microsoft Responsible AI Standard

Microsoft

负责任 AI 原则工程化

6 原则(公平/可靠安全/隐私安全/包容/透明/可问责)+ Impact Assessment 工具

NIST Generative AI Profile (AI 600-1)

NIST

GenAI 风险映射

将幻觉、越狱、数据污染等 GenAI 风险逐条映射到 AI RMF 四职能

CSA AI Security / Top Threats

云安全联盟

云上 AI 威胁 taxonomy

AI 威胁分类、Securing AI 报告、AI 供应链安全指引

Singapore Model AI Governance Framework

IMDA/PDPC

治理框架+测试工具

第二版(2020):内部治理/风险管理/用户交互原则 + AI Verify 测试框架

UK AISI / Frontier AI Safety

英国 AI 安全研究所

前沿模型安全评估

Inspect 评估平台、模型能力/危险红队评估方法学

NSA/CISA 安全部署 AI 指南

美国家安全局等

采购与部署基线

《Deploying AI Systems Securely》——提供方/使用方双向安全检查清单

五、六维能力对比雷达

将 5 个代表性框架在 6 个能力维度(1–5 分,主观评估用于说明取向)上对比,直观呈现"各有所长、需组合使用"。

图 6 主流框架六维能力雷达(1–5 分,取向性评估)

如何读这张图

·NIST AI RMF治理/伦理维度饱满,但技术控制与威胁建模偏薄——它是"大脑"不是"手脚"。

·OWASP LLM技术控制与操作性极强,但治理与合规覆盖弱——它是"攻击面清单"。

·MITRE ATLAS威胁建模拉满,治理/伦理几乎为零——它是"红队地图"。

·ISO 42001治理+合规双高,且可认证——它是"体系底座"。

·Google SAIF技术控制与操作性均衡——它是"工程抓手"。

结论:没有任何单点能覆盖全部维度。

推荐基线组合 =ISO 42001(体系)+ NIST AI RMF(治理方法论)+ OWASP LLM(应用风险)+ MITRE ATLAS(红队)

六、横向对比矩阵

从发布方、性质、核心维度、是否可认证、对行业落地价值等角度横向对比。单元格颜色:高/中/低/不适用。

维度

NIST AI RMF

OWASP LLM 2025

MITRE ATLAS

ISO/IEC 42001

Google SAIF

EU AI Act

发布方性质

政府标准院

开源社区

政府/国防实验室

国际标准化组织

科技企业

立法机构

框架类型

风险管理

风险清单

威胁知识库

管理体系

工程控制

法规

治理成熟度

技术控制深度

威胁建模能力

合规可映射性

可认证

法定

开发侧友好

行业落地价值

治理蓝图

应用防护

红队验证

认证合规

工程落地

强制合规

七、统一 AI 安全防护参考架构

将前述框架"翻译"为一套可落地的分层防御架构。自上而下五层,每层标注对应框架与控制抓手。该架构可作为各类组织 AI 系统安全设计的通用基线,与具体行业强监管叠加适用。

图 7 统一 AI 安全防护分层参考架构(治理→数据→模型→应用→检测,横切安全底座)

设计原则:①纵深防御——任一层失效不导致全局失守;②安全左移——治理与数据控制前置到训练前;③最小权限——Agent 工具调用必须受约束;④可观测——所有层输出统一接入检测响应层;⑤合规嵌入——将 EU AI Act / 42001 要求映射为具体控制项而非事后整改。

八、威胁建模方法论:OWASP × ATLAS 联动

把"风险清单(OWASP)"与"攻击链(ATLAS)"联动,形成可执行的威胁建模闭环:识别风险 → 映射攻击技术 → 部署控制 → 红队验证。

OWASP 2025 风险

对应 ATLAS 技术

推荐控制(对应架构层)

LLM01 提示注入

AML.T0051 提示注入(直接/间接)

指令/数据上下文隔离、结构化输出(③④层)

LLM02 敏感信息泄露

AML.T0048 从 RAG 收集;AML.T0091 泄露

输出过滤器、PII 脱敏、检索范围限制(③④层)

LLM03 供应链漏洞

AML.T0018 获取/构造恶意 ML 模型

SBOM、模型签名校验、第三方评测(②⑤层)

LLM04 数据/模型投毒

AML.T0020 投毒训练数据;AML.T0046 后门

数据出处追踪、统计异常检测(②层)

LLM06 过度代理

AML.T0054 访问 AI 代理配置;AML.T0086 执行

最小权限工具矩阵、人审确认、限流(④层)

LLM08 向量/嵌入弱点

AML.T0048 从 AI 服务收集;AML.T0049 检索操纵

RAG 文档消毒、检索访问控制(②③层)

LLM10 无界资源消耗

AML.T0040 模型拒绝服务;推理 API 滥用

token 预算、超时、成本告警(③层)

闭环建议:每季度基于 ATLAS 案例库做一次 Purple Team 演练,将发现回填至 OWASP 风险登记册,并同步更新 42001 的风险评估与 EU AI Act 的事件通报流程。威胁建模不是一次性活动,而是与架构演进同步的"活文档"。

九、跨行业落地实践

AI 已渗透各行业,但"高风险"的形态各异:互联网平台怕内容/推荐失控、医疗怕误诊、制造怕产线误控、政务怕歧视与滥用。框架的取法相同,场景化的风险重点不同。下面先给通用落地四支柱,再给出分行业"风险—框架"映射。

9.1 分行业风险与框架映射

行业

典型 AI 应用

首要安全风险

重点适用框架

企业生产力

智能办公、代码助手、企业知识库问答

提示注入致数据泄露、过度代理误操作系统、代码生成含漏洞

OWASP LLM01/06 · Google SAIF · MITRE ATLAS

医疗健康

诊断辅助、影像识别、病历摘要

幻觉致误诊、PHI 隐私泄露、偏见致漏诊

OWASP LLM09/02 · EU 高风险 · NIST Measure

政务与公共服务

审批辅助、智能问答、舆情分析<o:page>

算法歧视、深度伪造、数据滥用

EU 高风险 · ISO 38507 · OWASP LLM09

制造与能源

质检视觉、调度预测、运维 Agent

对抗样本致误判、OT/ICS 安全、Agent 误控设备

MITRE ATLAS · Google SAIF · ISO 5338

零售与电商

推荐、客服、营销内容生成

提示注入、品牌误导、成本滥用

OWASP LLM01/10 · Google SAIF

教育

智能辅导、自动阅卷、招生筛选

成绩/录取偏差、未成年数据隐私

OWASP LLM09/02 · 隐私增强技术

9.2 通用落地四支柱

① 治理与合规(满足监管预期)

·以ISO 42001建立 AI 管理体系,与既有 ISO 27001 合并审核,降低合规成本。

·以NIST AI RMF的 Govern/Map 明确 AI 资产台账与风险偏好。

·对高风险场景(医疗诊断、审批、调度、内容审核等)按EU AI Act 高风险逻辑做影响评估与人工监督(即使非欧盟机构,亦可借鉴其高强度要求)。

·对齐所在行业的监管要求(医疗、政务、制造等),将治理要求固化为制度与审批流。

② 应用与模型防护(抵御攻击)

·对面向用户的 Agent / RAG 系统重点防护OWASP LLM01/06/07:提示注入、过度代理、系统提示泄露。

·对知识库(制度/产品/病历文档)落实LLM08文档消毒与检索鉴权。

·推理端点配置LLM10限流与成本预算,防止提示膨胀型 DoS。

·用MITRE ATLAS对关键模型做对抗样本与投毒红队(如质检视觉、内容审核模型)。

③ 数据与隐私(守住底线)

·训练/微调数据落实出处追踪与投毒检测(对应LLM04)。

·个人与敏感信息(PII/PHI)在提示与检索中强制脱敏(对应LLM02)。

·采用隐私增强技术(联邦学习、差分隐私)满足数据保护法规要求。

④ 监测与应急(持续可信)

·将 AI 威胁信号接入既有 SOC,按SAIF 要素2统一检测响应。

·建立 AI 事件通报流程,对齐EU AI Act与所在行业监管报送要求。

·对生成内容做幻觉率/越狱率持续度量(NIST Measure)。

跨行业风险提醒:

① 企业生产力——代码助手泄露内部代码、知识库 Agent 过度代理误删数据;

② 医疗——诊断助手幻觉致误诊、PHI 泄露;

③ 制造——对抗样本致质检/调度误判、运维 Agent 误控设备;

④ 政务——算法歧视与深度伪造滥用。凡涉及"人、财、物、命"的高影响决策,必须将"人审确认"与"最小权限"作为强制控制,不可依赖模型自我约束。

十、AI 安全成熟度模型

以四级模型评估组织 AI 安全能力,便于定位现状与设定目标。

Level 1 被动

Ad-hoc 临时应对

无专门治理;安全靠个人经验;AI 上线无安全评审;出现事故才响应。

Level 2 定义

Defined 制度建立

建立 AI 资产台账;采用 OWASP LLM 做上线前检查;有基础提示注入防护。

Level 3 量化

Measured 度量驱动

落地 42001/AI RMF;红队常态化;幻觉/越狱率纳入度量;事件可溯源。

Level 4 优化

Optimizing 自适应

安全能力平台化、自动化;ATLAS 联动 SOC;合规嵌入 CI/CD;持续对抗演进。

十一、实施路线图(四阶段)

面向从 0 到 1 的组织(无论行业),给出 6–12 个月可执行的路线。各阶段均标注主导框架。

阶段

时间

目标

主导框架

关键交付物

阶段一 · 立基

0–2 月

摸清家底、明确责任

ISO 42001 / NIST Govern

AI 资产台账、AI 伦理委员会、政策制度 v1

阶段二 · 防护

2–5 月

堵住应用层高危风险

OWASP LLM 2025 / SAIF

提示注入防护、输出校验、限流、RAG 消毒、Agent 最小权限

阶段三 · 验证

5–9 月

红队验证与体系化

MITRE ATLAS / AI RMF

红队报告、度量看板、42001 内审、风险评估文档

阶段四 · 合规

9–12 月

认证与持续运营

ISO 42001 认证 / EU AI Act

外审认证、合规映射、事件通报流程、年度复审

节奏建议:阶段一、二可并行启动,避免"先治理后安全"导致线上风险暴露;阶段三的度量数据应回流支撑阶段四的认证证据。对于已具备 ISO 27001 基础的机构,阶段四可显著提速。

十二、挑战与趋势

关键挑战

·标准碎片化:多框架术语不一,企业"拼图"成本高,需建立内部映射字典。

·度量难题:AI 安全缺乏如"漏洞数"的通用指标,幻觉率/鲁棒性度量尚未标准化。

·Agent 新面:自主智能体的权限与工具调用使传统"边界"失效,过度代理成头号难题。

·供应链黑箱:第三方模型/数据集不可见,SBOM 与模型出处仍不成熟。

演进趋势

·合规驱动收敛:EU AI Act 与各国立法将倒逼框架"互认",42001 有望成国际通用底座。

·红队常态化:ATLAS + 自动化红队工具将成为安全运营标配。

·安全左移到训练:从"推理防护"前移到"数据/训练安全"。

·AI 守护 AI:用模型监测模型行为,异常检测走向自适应。

十三、结论

AI 安全框架已经形成"治理(ISO 42001 / NIST AI RMF)— 风险(OWASP LLM)— 对抗(MITRE ATLAS)— 工程(Google SAIF)— 合规(EU AI Act)"的完整生态。

对各类组织而言,关键不是"选哪个框架",而是建立组合能力:以可认证的 42001 为体系底座,以 AI RMF 为治理方法论,以 OWASP LLM 2025 守住应用风险,以 ATLAS 持续红队验证,并将 EU AI Act 的高强度要求作为合规上限。

本报告第 7 章的分层参考架构与第 11 章的四阶段路线图,提供了从"临时应对"走向"自适应优化"的可执行路径。在智能体时代,最小权限、人审确认与安全左移将不再是可选实践,而是 AI 安全的底线工程。

一句话总结:用 ISO 42001 立体系,用 NIST AI RMF 想清楚,用 OWASP LLM 防住面,用 MITRE ATLAS 攻验真,用 EU AI Act 兜底线——五位一体,方能在跨行业 AI 落地中行稳致远。

十四、参考文献

1.NIST,AI Risk Management Framework (AI RMF 1.0), NIST AI 100-1, 2023;配套Generative AI Profile(AI 600-1), 2024.

2.OWASP,Top 10 for Large Language Model Applications – 2025 Edition (v2.0), 2025-05.

3.MITRE,ATLAS – Adversarial Threat Landscape for AI Systems(v5.4.0, 2026-02).

4.ISO/IEC 42001:2023AI Management System;ISO/IEC 23894:2023;ISO/IEC 38507:2022;ISO/IEC 5338;ISO/IEC TR 5469.

5.Google,Secure AI Framework (SAIF)与 SAIF Risk Map / Controls, 2024.

6.European Union,Regulation (EU) 2024/1689 (AI Act);AI Act implementation timeline (European Commission / European Parliament).

7.Microsoft,Responsible AI Standard与 Impact Assessment 工具.

8.Cloud Security Alliance (CSA),AI Security Threat Taxonomy/Securing AI系列报告.

9.IMDA & PDPC (Singapore),Model AI Governance Framework (2nd ed.)与 AI Verify.

10.NSA / CISA / CSI,Guidance on Deploying AI Systems Securely, 2024.

11.UK AI Safety Institute (AISI),Inspect评估平台与方法学.

说明:本报告框架版本与数据截至 2026-07;雷达图评分为取向性说明,非官方定量评级。具体落地请结合最新官方文档与本地监管要求。

原文链接:

主流 AI 安全防护框架研究报告