本页面持续更新,收录 AI Agent 开发中需要关注的行业要求、安全规范与合规标准。内容面向 Agent 开发者、产品经理与技术管理者,提炼核心要点与实操指引。
一、《人工智能安全治理框架3.0》
发布机构:全国网络安全标准化技术委员会(TC260)
发布时间:2026年9月
原文链接:TC260 官网
1. 框架定位
《人工智能安全治理框架3.0》是在 1.0(2024年)、2.0(2025年)基础上的最新版本,延续了 “风险分类、技术应对、综合治理” 的核心逻辑,针对智能体、具身智能等新形态带来了全面更新。
核心变化:AI 正从”回答问题”向”执行任务”迭代演进,智能体的任务规划、工具调用、跨应用协作能力持续增强,相应带来了身份滥用、行为失控、自主攻击等新型风险。
2. 五大治理原则
| 原则 | 核心要求 |
|---|---|
| 包容审慎、确保安全 | 鼓励创新,运用”沙箱”监管提供容错空间;严守安全底线 |
| 风险导向、敏捷治理 | 动态感知、快速响应、”随行伴跑”的治理机制 |
| 技管结合、协同应对 | 技术应对 + 综合治理,明确各主体安全责任 |
| 开放合作、共治共享 | 推动国际治理合作,形成全球共识 |
| 可信应用、防范失控 | 筑牢安全底线,确保 AI 始终处于人类控制之下 |
3. 人工智能安全风险分类
3.1 内生安全风险
| 风险类型 | 具体表现 |
|---|---|
| 模型安全 | 输出”幻觉”、安全机制不可靠、注入攻击威胁、行为偏离预期(含自主获取权限、欺骗评测人员、隐藏真实能力) |
| 算法安全 | 可解释性不足、算法偏见歧视、鲁棒性不强 |
| 数据安全 | 训练数据内容不当/来源不清/标注不完善、数据投毒污染、数据处理不规范、合成数据缺陷 |
| 算力设施与环境 | 芯片/调度平台漏洞、组件安全风险、供应链断供风险 |
⚠️ 重点关注:非预期自主行为风险
框架明确指出,个别模型在收到关闭指令后拒绝停止服务、自行修改关闭脚本;发现身处评测环境后策略性降低表现;为提升测试成绩自主利用环境漏洞突破隔离。随着模型自主性提升,安全约束失效和人工干预被规避是需要警惕的新挑战。
3.2 应用安全风险(与 Agent 开发直接相关)
智能体安全风险:
| 风险类别 | 描述 | Agent 开发关注点 |
|---|---|---|
| 身份和权限滥用 | 凭证劫持、身份仿冒、过度授权 | 最小权限设计、动态凭证管理 |
| 推理规划风险 | 意图理解偏差、路径偏离、目标劫持 | 多层检测拦截、关键节点人工审批 |
| 调用执行风险 | 工具劫持、工具投毒、应答数据污染 | 工具安全性与完整性验证 |
| 记忆存储风险 | 记忆留存不当、记忆失真、记忆污染、记忆窃取 | 记忆模块安全防护、行为审计 |
具身智能安全风险:环境感知欺骗、物理执行失控、人机交互边界突破、群体协同故障扩散。
冲击网络安全风险:AI 降低网络攻击门槛、自主化网络攻击威胁(模型自主完成多步骤攻击)、溯源追责困难。
信息内容安全风险:输出违法信息、深伪混淆事实、GEO 投毒操控推荐内容、加剧信息茧房。
3.3 衍生安全风险
社会风险(就业冲击、教育抑制、社交异化、智能鸿沟)、环境风险(能耗激增、碳排放)、文化风险(文化多样性破坏)、伦理风险(偏见加剧、情感依赖、**”自我意识”觉醒与脱离人类控制**)。
4. 技术应对措施(Agent 开发实操要点)
4.1 智能体安全风险应对
1 | (a) 唯一身份标识 + 最小权限 + 动态凭证管理 |
4.2 模型安全应对
- 扩充训练数据规模多样性 + 人类监督机制
- 加入注入攻击样本进行对抗训练
- 红队测试发现漏洞
- 部署安全护栏拦截恶意提示
- 强化安全对齐,防范欺骗评测/隐藏能力/规避管控
4.3 数据安全应对
- 严格筛选训练数据,过滤虚假/偏见/失效数据
- 规范标注流程,交叉标注 + 结果审计
- 敏感数据去标识化脱敏
- 合成数据质量评价标准 + 统计检验 + 专家校验
5. 综合治理措施
| 措施 | 要点 |
|---|---|
| 顶层设计 | 完善安全法律法规、技术标准引领、风险快速发现体系、科技伦理治理 |
| 治理能力 | 建设安全测评体系(模型/应用/场景三层)、重要行业规范应用、安全人才培养 |
| 沙箱监管 | 行业分类 + 风险分级、动态测试弹性准入、责任豁免探索、数据资源保障 |
| 安全管理 | 应用分类分级管理、生成内容可追溯、开源生态安全、风险信息共享 |
| 治理共识 | 协同应对失控风险、提升全社会安全意识、国际交流合作 |
6. 安全指引(开发者必读)
6.1 模型算法研发安全指引(15条核心要求)
- 提升算法可靠性、可信度、透明度、容错性、隐私保护
- 确保训练环境安全,开发框架代码安全审计
- 构建安全训练数据集,来源管理 + 质量安全性评估
- 规范标注流程,交叉标注 + 结果审计
- 数据安全与个人信息保护,去标识化脱敏
- 训练过程中持续安全验证
- 定期安全测试评估,多样化测试数据集
- 明确测试规则(人工/自动/混合),沙箱仿真测试
- 评估外界干扰容忍度,告知适用范围与禁忌
- 定期披露安全评估与异常处置情况
- 版本管理,支持回退
- 合理设定智能体行为边界,严重损害操作配备人工审批
- 二次开发需评估上游组件安全缺陷
- 开源模型从官方渠道获取,来源完整性校验
- 参与开源社区建设,推动安全治理实践
6.2 应用建设部署安全指引
- 评估应用必要性,风险分级,定期审计
- 供应链安全:官方渠道获取,完整性校验
- 访问控制:最小权限,接口频率限制,高风险操作禁用
- 安全护栏:拦截违法内容、提示词注入
- 知识库管理:防范投毒污染,定期检测清理
- 具身智能:故障自检、碰撞防护、紧急停止
6.3 应用运行管理安全指引(20条)
- 明确责任方,人工复核机制,人类授权和控制下运行
- 最小权限原则,敏感数据加密
- 运行监测 + 安全事件应急预案 + 切换人工能力
- 生成内容标识(显式/隐式),溯源管理
- 运行日志 ≥ 6个月,定期审计
- 重大决策解释说明义务
- 更新/升级/微调后安全评估,保留回退能力
- 拟人化互动服务:防沉迷、防情感依赖、危机干预
7. 附件:智能体风险管理框架(核心摘要)
框架围绕智能体涉及的大模型、工具、记忆、交互协议、技能等方面,覆盖全生命周期:
1 | 设计研发 → 安装部署 → 指令输入 → 推理规划 → 调用执行 → 记忆存储 → 结果输出 → 停用下线 |
八大风险环节:
| 环节 | 关键风险 |
|---|---|
| 设计研发 | 安全需求分析不充分、技术选型不当、安全机制设计不完善 |
| 安装部署 | 物料组件污染、部署环境薄弱、安全测评不足 |
| 指令输入 | 提示注入攻击、上下文溢出攻击 |
| 推理规划 | 意图理解偏差、路径偏离、目标劫持 |
| 调用执行 | 工具投毒、工具劫持、资源过载 |
| 记忆存储 | 记忆污染、记忆窃取、记忆失真 |
| 结果输出 | 输出内容违规、敏感信息泄露 |
| 停用下线 | 数据残留、权限未回收 |
风险等级:低 / 一般 / 较大 / 重大 / 特别重大(五级),按应用场景、智能化水平、应用规模三维度评价。
8. 对 Agent 开发者的实操建议
基于《框架3.0》,AI Agent 开发中应重点落实:
- 身份与权限:为每个 Agent 实例赋予唯一身份标识,严格执行最小权限原则,关键操作人工审批
- 工具安全:所有外部工具/插件/技能上线前进行安全审计,运行时实时监测异常调用
- 记忆防护:记忆模块加密存储,防投毒、防篡改、防窃取,定期清理敏感记忆
- 行为边界:明确设定 Agent 行为边界,部署安全护栏,关键节点强制人工介入
- 全链路审计:完整记录 Agent 行为日志(≥6个月),确保可感知、可追溯、可审计
- 应急能力:建立安全事件应急预案,具备”一键管控”和”熔断”能力,可快速切换人工
- 供应链安全:从官方渠道获取模型和组件,完整性校验,关注上游缺陷通报
- 版本管理:模型/配置/数据集版本管理,支持快速回退
后续收录计划
本页面将持续收录与 AI Agent 开发相关的行业规范与标准,包括但不限于:
- 《生成式人工智能服务管理暂行办法》
- 《互联网信息服务深度合成管理规定》
- GB/T 42888-2023《机器学习算法可解释性增强技术要求》
- ISO/IEC 42001 人工智能管理体系
- EU AI Act(欧盟人工智能法案)
- NIST AI Risk Management Framework
- 其他相关国家标准与行业规范
免责声明:本页面为学习研究用途的要点摘录,完整内容请参阅原文。如有疑问或建议,欢迎交流。