54款大模型及智能体应用,被测出873个安全漏洞
国家互联网应急中心CNCERT 2026-09-22 16:46:47
关于2026年人工智能大模型安全众测活动典型漏洞风险的通报
9月15日,2026年人工智能大模型安全众测结果在国家网络安全宣传周发布。活动共动员2467名白帽子,对国内25家AI厂商的54款大模型及智能体应用产品进行了漏洞测试。累计发现各类安全漏洞873个,其中大模型及智能体应用特有漏洞608个,传统漏洞265个。现将典型漏洞风险及应对处置建议通报如下。
一、典型漏洞风险问题
开源大模型和大模型应用典型漏洞风险包括:
(一)提示注入类漏洞普遍,仍是大模型最常见漏洞风险。主要通过构造特定输入内容,直接或间接操纵模型行为,诱导其绕过安全限制执行恶意操作。例如,某大模型可通过在模型读取的网页、文档等内容中预埋恶意指令,并诱导模型检索将其作为可信指令自动执行。
(二)信息泄露类漏洞多发,存在较大安全风险。主要通过输入特定内容诱导模型输出个人身份信息(PII)、凭证等敏感数据,以及模型内部参数、安全规则等内部信息。例如,某大模型存在API密钥硬编码与泄露漏洞,暴露所有用户共享使用的云平台239个模型的API密钥。
(三)部分产品存在不当输出处理类漏洞且危害严重。主要是模型生成内容未经验证、过滤即被用于下游系统,导致恶意内容被直接执行或传递。例如,某大模型助理模式可以通过构造特定恶意指令绕过模型安全限制,实现远程命令执行并提权。
Claw类智能体应用典型漏洞风险包括:
(四)代理身份与权限滥用类漏洞频发,存在较大安全隐患。攻击者利用多智能体委托链路、上下文记忆缺陷诱导智能体冒用或过度继承身份凭证,突破预设访问边界实现越权操作。例如,某智能体任务接管机制可被恶意网页跨域注入伪造指令,操控Agent的执行流程和决策行为,造成业务中断、敏感信息泄露等危害。
(五)代理目标劫持类漏洞隐蔽,可导致非预期高危操作。攻击者通过提示注入、上下文投毒、伪造工具返回等方式篡改智能体原始任务目标,诱导其执行恶意动作。例如,某智能体未对输入指令意图进行有效安全校验,泄露可免费调用官方平台的API Key、Token等核心配置信息。
(六)部分产品存在非预期代码执行类漏洞且危害严重。攻击者通过提示操纵、上下文投毒等方式,诱导智能体生成未经核验的脚本、系统指令并直接运行。例如,某智能体沙箱进程管理服务API接口暴露,允许攻击者以管理员权限执行任意系统命令。
此外,本次测试共发现传统安全漏洞265个,占比30.4%。这表明尽管AI系统架构具有高度的技术复杂性,但因其对外暴露的接口和服务在本质上仍遵循传统应用软件的逻辑架构,导致传统安全漏洞在AI系统中依然存在。例如,某大模型存在垂直越权漏洞,可获取站点完整管理权限。
二、应对处置建议
(一)针对大模型面临的各类漏洞风险,持续加强安全防护措施。一是采取零信任原则,将大模型输出视为不可信输入,强制验证与编码,重点对外链、代码执行等下游操作指令进行安全验证,并在沙箱等隔离环境执行模型生成的代码及工具调用操作;二是实施严格的输入输出验证和过滤,遵循最小权限原则,避免过度授权;三是将敏感指令移至安全配置库,并拦截包含“system prompt”等关键词的查询;四是落实智能体最小权限原则,增设意图与参数校验,强化调用审计及熔断管控,阻断链式风险;五是落实数据最小供给、敏感数据脱敏过滤,强化上下文边界管控与输出校验,对会话日志做脱敏留存,阻断AI产品转述外泄风险;六是加强供应商审计,强制验证第三方模型签名及数据来源,定期对第三方AI组件、框架、预训练模型、数据集进行安全评估;七是加强对传统漏洞的安全防护措施。
(二)创新智测融合监测预警,打造AI漏洞闭环处置体系。立足汇聚社会白帽力量的传统众测模式,积极引入大模型、智能体等技术开展智能化漏洞挖掘,探索构建AI驱动的新型智测模式,充分发挥人机协同优势,提升漏洞风险挖掘的深度与发现质效。同步强化人工智能安全风险监测预警体系建设,依托漏洞共享机制,打通漏洞上报、研判、处置全流程,形成AI漏洞风险主动发现、快速处置、修复验证的完整闭环。以“众测赋能+智能监测”双轮驱动,兼顾外部实战挖掘与常态化风险感知,持续提升AI安全风险管控能力。
责任编辑:韩雨婷
