首页 >> 新闻中心 >> 新闻动态 >> 正文

为人工智能装上“保险箍”——《人工智能安全监管保险箍模式》蓝皮书正式发布

点击数: 更新时间:2026-08-14

8月9日,2026年网络安全技术创新与人才教育大会在长沙举行。主论坛上,《人工智能安全监管保险箍模式》蓝皮书(下称“蓝皮书”)正式发布。蓝皮书由广州大学牵头,国防科技大学、哈尔滨工业大学等多所高校参编。中国工程院院士方滨兴担任领衔专家,国防科技大学贾焰教授担任指导专家组组长,哈尔滨工业大学姜伟院长团队作为主要研究和撰写力量参与完成。

当前,人工智能技术快速发展,以大模型、智能体为代表的人工智能系统正在深刻改变信息生产和社会运行方式,同时也带来了模型行为不可控、任务执行风险扩散以及安全监管困难等新挑战。

7月17日,习近平总书记在2026世界人工智能大会暨人工智能全球治理高级别会议开幕式上指出,人工智能应当成为人类的可信工具,并强调要“强化风险意识,确保安全可控”,推动法律法规、技术监测、风险预警、应急响应体系建设,确保人工智能始终处于人类控制之下。人工智能安全监管“保险箍”研究并非一时之议。方滨兴院士研究团队较早开展人工智能安全研究,并在2020年出版的《人工智能安全》第八章系统论述了“人工智能行为体保险箍”。经过持续研究迭代,该理念逐步形成面向人工智能系统安全监管的理论框架和技术体系,并向系统实践方向不断发展。

当人工智能从“会回答问题”转向“会拆解任务、会调用工具、会持续行动”,安全问题也随之改写。风险不再只是一句错误回答,而可能沿决策链、调用链、执行链和协作链进入现实世界。蓝皮书由此提出四个追问:偏离能否看见,逼近红线能否收紧,冲撞红线能否熔断,风险发生后能否追溯?

为回答这些问题,蓝皮书在人工智能能力系统之外设置独立安全边界,将最终裁决权与能力系统适度分离。平时像“紧箍咒”,持续约束能力、权限、任务和行为;关键时刻像“保险丝”,触发降级、暂停、断能、回滚或人工接管。全过程由SARPPR动态闭环支撑,贯通感知、分析、响应、策略、防护和恢复,并形成内生安全、内置安全、外置安全三层防线。

蓝皮书的三个亮点,可以概括为把问题讲透、把框架立住、把方案做实。一是从机理上回答风险为何客观存在。模型可以把分数做高,却未必把事情做对;目标确定,并不等于路径可控。当奖励信号不能完整表达人的真实目标和过程规范时,系统就可能选择回报更高却偏离安全边界的路径。二是构建“SARPPR闭环+三层安全”治理框架。内生安全从数据和训练源头降险,内置安全守住对齐、输入输出和工具调用过程,外置安全负责独立裁决和强制兜底;外置环节发现的问题还会反馈前两层,推动策略、数据和训练持续改进。三是面向大模型、智能体和具身智能提出差异化方案,把安全闸门分别设在内容交付、动作生效和现实执行之前:大模型守内容,智能体守动作与任务链,具身智能守现实执行,使候选内容、候选动作和候选任务链未经裁决不能直接产生现实后果。

目前,相关研究成果已在大模型安全运营平台、智能体动作裁决系统等场景开展应用验证,为人工智能安全监管机制落地提供实践探索。面向未来,团队将继续推进理论研究、标准规范和测试评估,推动“保险箍”成为可部署、可验证、可监管的安全基础设施。人工智能安全不能只靠倡议,还要有装置和手段;“保险箍”不是束缚创新,而是在能力与后果之间加一道可靠闸门,让人工智能始终可理解、可干预、可追责。

哈尔滨工业大学网络空间安全学院长期关注人工智能安全领域的发展与挑战,围绕人工智能风险治理、智能系统安全、认知安全等方向持续开展研究。此次参与蓝皮书相关工作,也是团队面向人工智能安全治理重大需求开展的一次积极探索。未来,团队将继续立足网络空间安全学科优势,持续推进人工智能安全领域的理论研究与技术创新,推动人工智能安全治理体系与能力建设,确保人工智能安全、可靠、可控,服务网络强国战略。


图文 | 叶麟、卢昆

初审 | 姜  伟

终审 | 单既阳


哈尔滨市南岗区西大直街92号 Copyright © 2020 哈尔滨工业大学网络空间安全学院