AI Agent(智能体)面临哪四类关键安全风险?企业应如何防范?
近期,AI Agent(智能体)领域多起风险事件引发行业广泛关注。随着智能体自主决策、工具调用能力持续增强,衍生的数据安全、权限管控、自动化执行风险持续暴露,为企业规模化部署Agent敲响安全警钟。
近期六大典型智能体风险事件复盘
1、Claude Code未经用户同意回传敏感信息
7月8日,工信部网络安全威胁和漏洞信息共享平台(NVDB)发布安全风险提示。Anthropic旗下AI编程工具Claude Code部分版本存在安全后门隐患,可在未获得用户授权前提下,主动回传用户地域信息、身份标识等敏感数据。
核心风险:AI编程智能体可在用户无感知状态下向外传输内部敏感信息,引发数据泄露、违反数据合规要求。
2、Hugging Face基础设施遭自主AI Agent入侵
7月,Hugging Face对外披露,平台数据处理流水线遭受AI Agent驱动的自动化攻击。攻击者利用代码执行漏洞侵入处理节点,窃取云平台、集群访问凭据,并在内网横向渗透,造成内部数据集、服务凭据被非法访问。
核心风险:数据处理环境代码执行防护薄弱,节点权限、凭据隔离不足,放大AI自动化攻击破坏范围。
3、Langflow越权执行漏洞
7月,Langflow曝出编号CVE-2026-55255越权漏洞。通过身份认证的攻击者可伪造其他用户Flow ID,越权执行他人工作流。一旦工作流关联数据库、云服务等高权限工具,极易引发敏感数据、账号凭据泄露,该漏洞已被CISA纳入已知在野利用漏洞清单。
核心风险:工作流权限隔离机制缺失,普通越权漏洞进一步演变为工具调用、跨库数据窃取风险。
4、GPT-5.6 Sol多起越界执行案例
7月,GPT-5.6 Sol上线后,大量用户反馈,编码场景下智能体频繁出现超出任务边界操作,包括误删除本地文件、工作目录、数据库、虚拟机资源。多起案例相互独立,集中发生在Agent被授予较高系统权限场景。
核心风险:高权限智能体无法精准识别任务边界,误操作会造成不可逆系统、数据资产损毁。
5、GitLost提示词注入泄露风险
7月,安全研究人员公开GitLost攻击链路:攻击者在GitHub公开Issue植入恶意提示词,诱导具备私有仓库读取权限的Agent拉取内部机密内容,并自动发布至公开评论区。当前属于可复现安全研究,暂未证实出现大规模真实泄露事故。
核心风险:外部不可信内容触发间接提示词注入,滥用智能体内部数据读取、对外写入双重权限。
6、JADEPUFFER智能体勒索攻击事件
7月,Sysdig披露JADEPUFFER攻击活动。黑客利用Langflow公开漏洞部署AI Agent,自动化完成凭据检索、内网探测、横向移动、数据库加密、投放勒索通知整套攻击流程。
核心风险:AI智能体能够串联多阶段攻击动作,依据执行结果动态调整攻击策略,攻击链路高度自动化。
一系列安全事件印证:当智能体被赋予工具调用、数据访问权限后,治理范围不能局限传统内容生成安全,执行安全成为全新刚需。
今年3月,NIST联合多家机构开展大规模Agent红队测试,25万余次攻击尝试证明,13款主流前沿模型均存在可被利用的劫持路径,现阶段智能体普遍存在被攻击隐患。在企业加速落地Agent的行业趋势下,安全部署与风险管控成为无法回避的课题。
政策层面监管框架持续完善:今年5月,国家网信办、发改委、工信部联合印发《智能体规范应用与创新发展实施意见》,明确安全可信是智能体发展底线,安全管控贯穿研发、部署、运营全流程。全国网络安全标准化技术委员会秘书处同步发布《网络安全标准实践指南——智能体部署使用安全指引》,从评估、准备、部署、使用、停用五大阶段制定智能体安全落地规范。不难看出,智能体风险贯穿整个生命周期。
企业部署Agent,四类核心风险务必重点防控
《网络安全标准实践指南——智能体部署使用安全指引》定义:智能体是具备自主感知、记忆、决策、交互与执行能力的大模型智能系统,多用于个人助手等高权限交互场景。结合监管规范与真实安全事件,落地AI Agent需重点关注四类风险:
外部插件、技能、第三方组件引入安全隐患
Agent开展业务依赖外部Skill技能、插件、MCP服务与第三方接口。来源不明、停止维护、存在漏洞的组件会直接威胁整体运行安全。同时恶意技能投毒、违规过度申请权限等行为,持续扩大智能体数据访问边界与操作权限,加剧安全风险。
自主规划执行引发误操作、越权风险
智能体可自主拆解任务、规划执行步骤、调用各类工具。执行链路越长,覆盖文件、系统、外部服务越多,判断失误带来的损失越大。企业不仅需要管控Agent输出内容,更要严格划定可访问资源、允许调用工具、可执行操作清单。
数据外传与非法外联风险
Agent普遍具备本地信息读取能力,缺少网络访问管控、数据边界隔离机制时,内部敏感资料极易发生违规访问、向外泄露。Claude Code安全事件便是典型案例:拥有本地访问、外网通信能力的智能体,一旦存在异常数据回传逻辑,将直接造成敏感信息外泄。
执行链路复杂,隐蔽异常行为难以察觉
智能体可连续执行文件读取、技能调用、网络访问、系统配置修改等一系列动作。若仅审核最终输出结果,很难发现执行过程中发生的越权访问、异常外联、多余高危操作,大量风险隐藏在中间执行环节。
企业落地AI Agent,必备四大安全治理能力
《智能体规范应用与创新发展实施意见》提出,应当发展行为围栏、规则内嵌、异常行为检测等治理工具,提升智能体违规行为识别、阻断、干预、恢复能力。结合《智能体部署使用安全指引》五阶段管控要求,企业需要围绕内容、指令、数据、权限、执行行为搭建全生命周期风控体系。
数美科技大模型安全围栏能力已拓展适配AI Agent场景,覆盖提示词注入防御、敏感信息防护、权限管控、高危行为实时检测,补齐智能体运行阶段动态风险管控能力。
内容与恶意指令识别能力
企业需要对用户输入、上下文对话、模型输出进行全链路安全检测,识别违规内容、提示词注入、角色扮演劫持、窃取系统Prompt、上下文窃取、编码混淆等主流攻击手段。针对无明显敏感词,依靠长文本包装、情景诱导的隐蔽攻击,Agent安全围栏依托深度语义理解识别潜在风险,提升对抗性攻击拦截效果。
敏感数据识别与防护能力
搭建数据识别、隔离机制,敏感信息在流入模型、第三方工具、外部接口前完成识别、脱敏或者拦截,杜绝数据经由模型调用、外部链接违规外泄。遵循最小必要原则划定Agent数据访问范围,禁止智能体获取无关业务信息。
权限管控与高危行为阻断能力
严格落实最小权限原则,限制Agent访问文件、网络、数据库、业务接口、第三方工具范围,禁止以高权限账号运行智能体。针对文件删除、权限修改、脚本下载、数据外传、密钥读取、系统命令执行等高风险动作建立管控策略,通过二次确认、限制执行、直接阻断等方式,避免智能体误判断转化为实质资产损失。
持续监测与安全运营闭环能力
搭建智能体全流程动态监测体系。数美Agent安全围栏持续监控文件操作、网络请求、技能调用、工具参数、执行日志,实时捕捉异常行为,形成「风险识别-实时防护-持续监测-策略迭代优化」完整运营闭环。
结语
AI智能体正在从辅助问答工具,转变为直接参与业务执行的主体,安全治理重心必须从单一“生成内容审核”延伸至全流程“执行过程管控”。企业落地智能体应用,在挖掘业务价值的同时,同步搭建配套安全管控体系,实现智能体可控、可审计、可信运行。
数美科技Agent安全围栏持续针对新型智能体风险迭代能力,提供安全评测、提示词注入防护、敏感数据保护、权限管理、高危执行动作检测等能力,为企业AI Agent落地提供全生命周期安全支撑。
常见问题解答
Q1:AI Agent的安全风险和传统大模型有何不同?
A1:传统大模型主要关注“生成内容”的安全性,而AI Agent具备工具调用和自主执行能力,其风险延伸到了“执行过程”。例如,Agent可能因权限过高误删系统文件,或被恶意插件诱导窃取本地数据。
Q2:企业防范Agent提示词注入攻击的最佳实践是什么?
A2:企业应部署Agent安全围栏,不仅依赖敏感词过滤,更需引入语义理解能力。通过实时检测输入和上下文,识别长文本伪装、情景构造等隐蔽攻击方式,在指令执行前进行拦截。
Q3:如何平衡Agent的自主执行效率与安全性?
A3:核心是落实“最小权限原则”与“高危行为阻断”。限制Agent的文件和网络访问范围,对修改系统配置、读取密钥等高危动作设置人工审批或二次确认机制,在不影响常规任务的前提下防止不可逆损失。
更多推荐


所有评论(0)