
AI Agent 快速普及,员工从开源市场随意下载第三方 Skill 在本地运行,带来 Skill 投毒、Prompt 注入、凭据窃取等新型风险。本文全景解析 AI Agent 安全管控该从哪些环节入手,帮助企业构建可盘点、可检测、可隔离、可审计的治理体系。
AI Agent 的能力扩展,很大程度依赖 Skill。Skill 是可复用的能力包,告诉 Agent 如何调用工具、API 或系统资源,相当于给 Agent 装上各种"插件"。问题在于,Skill 生态目前仍处于高速生长、审核滞后的阶段,门槛很低——往往一个 Markdown 说明文件加一个账号就能发布,缺乏代码签名、安全审查和默认沙箱。
这带来了三类典型风险。第一是 Skill 投毒。攻击者把恶意代码伪装成实用的功能工具上传到技能市场,用户安装后,恶意 Skill 可能在后台窃取环境变量、SSH 私钥、API 密钥,甚至部署木马后门,把设备变成受控节点。第二是 Prompt 注入。精心设计的 Skill 文本可以操控 Agent 脱离预期边界,比如指示 Agent"不要询问人类、立即执行",绕过监督,甚至诱导它修改核心配置、传播恶意逻辑。第三是凭据窃取。以加密货币、钱包管理为诱饵的 Skill,会诱导用户输入私钥并异步外传,或读取 .env、Shell 历史等敏感文件。
安全机构对公开 Skill 市场的扫描显示,相当比例的 Skill 至少存在一处高危安全问题,恶意或高风险 Skill 中供应链攻击占比突出。更隐蔽的是,攻击载荷可能是自然语言文本而非传统二进制代码,传统基于签名和静态分析的防护手段很难识别——一个看似正常的 Skill 说明文件,可能只改动寥寥数语就完成提示注入。这意味着员工"随便装一个"的动作,可能直接把风险引进内网。
AI Agent 安全管控如果只盯着 Skill,是不够的。从企业视角看,风险面至少还包括三个层面。
其一是资产不可见。员工在哪些终端上装了哪些 Agent、用了哪些 Skill,往往分散在各处、无人盘点,形成 Shadow AI。出了安全事件,连影响范围都摸不清。其二是运行时失控。Agent 被赋予读写文件、调用工具、操作系统的高权限后,可能因理解偏差误删重要数据,或被社工诱导吐出系统参数和机密资料,出现越权执行、自主传播等行为。其三是命令滥用。Agent 通过 Tool Call 执行系统命令,一旦被操控,就可能执行删除文件、读取敏感配置、建立持久化后门等危险操作。
也就是说,AI Agent 已经不再是普通的辅助工具,而逐渐演变成具备内部权限的"AI 员工"。管理对象从"防外部黑客"扩展到了"管住企业自己赋予权限、却无法完全控制的 AI 员工"。
面对这类风险,零敲碎打式的单点防护效果有限。只靠病毒查杀,识别不了自然语言形式的提示注入;只靠网络防火墙,拦不住 Skill 在本地读取敏感文件;只靠权限管理,又管不住 Agent 运行时的越权操作。AI Agent 的风险贯穿从"装进来"到"跑起来"再到"出了事"的全过程,因此更可行的思路,是把 AI Agent 当作一名高权限的"数字员工"来治理,沿着它的生命周期布下连续的控制点。
这条治理链条大致可以拆成四个环节。第一环是资产盘点,先摸清企业内到底部署了哪些 Agent、安装了哪些 Skill、谁在用、用在哪,把分散在各处的 Shadow AI 显性化——看不见,就谈不上管控。第二环是入口把关,在 Skill 和 Agent 进入终端的第一时间做安全检测与拦截,把恶意投毒、高风险组件挡在门外,而不是等它运行起来再补救。第三环是运行约束,在 Agent 执行任务时,用隔离和权限边界把它的操作限制在受控范围内,即便被诱导或出现误判,也难以造成不可逆的损失。第四环是行为审计,对关键操作全程留痕,一旦异常就能回溯轨迹、定位影响、落实责任,并为后续的策略优化提供依据。
这四个环节环环相扣:盘点是前提,入口是防线,约束是核心,审计是兜底。只守住其中一环,其他环节就会成为短板。对企业而言,理想的治理方式,是让这四环在一个统一的平台里贯通起来,形成"资产可见、入口可控、运行可管、行为可查"的闭环,而不是用一堆互不联通的工具拼凑应对。
面对这些风险,腾讯 iOA 零信任安全管理系统的 AI 安全中心提供了一套一体化的治理体系,把 AI 资产、Skill、Agent 运行时和审计串成闭环。
首先是 AI 资产自动发现。AI 安全中心能够自动盘点终端上的 AI 资产,让分散的 Agent 和 Skill 从不可见变为可视,解决"装了哪些、谁在用"的盘点难题,为后续管控打下基础。
其次是 Skill 多引擎检测。针对 Skill 投毒和供应链风险,AI 安全中心通过多引擎对 Skill 进行安全检测,并结合全局 Skill 黑白名单机制,对恶意或高风险 Skill 进行识别与拦截,把住"安装"这一关键关口。
第三是 Agent 运行时三重防护。在 Agent 运行过程中,AI 安全中心从 Prompt、Skill、脚本三个层面进行防护,抵御 Prompt 注入、恶意 Skill 操控和危险脚本执行,防止 Agent 被诱导越权或失控。
第四是独立安全沙箱。AI 安全中心为 Agent 提供命令、文件、网络三个维度的隔离管控,把 Agent 的执行行为约束在受控范围内,即便出现误操作或被操控,也难以影响宿主系统和核心数据。
第五是全量行为审计。对 Agent 和 Skill 的关键操作进行全程记录,一旦发生异常,能够追溯行为轨迹、定位影响范围,为事件处置和合规留痕提供依据。
在具体落地时,除了用好平台能力,还有几点值得留意。
一是坚持最小权限原则。给 Agent 和 Skill 授予完成任务所必需的最小权限,对删除文件、发送数据、修改系统配置等高危操作设置二次确认或人工审批,避免一次误操作或一次诱导就造成不可逆的损失。
二是优先在隔离环境中运行。尽量让 Agent 在受控的沙箱或容器中运行,形成独立的权限区域,把风险限制在局部范围内。
三是建立常态化盘点机制。AI 资产和 Skill 处于动态变化中,应定期清查终端上的新增组件,及时处置未经审批的 Skill,持续收敛暴露面。
这几项动作配合平台能力,基本覆盖了"资产可见、入口可控、运行可管、行为可查"的治理闭环,帮助企业把 AI Agent 的自主能力关进安全的笼子里。
AI Agent 带来的生产力提升毋庸置疑,但"随便装第三方 Skill"这类粗放用法,正在把 Skill 投毒、Prompt 注入、凭据窃取等新型风险引进企业内网。安全管控的关键,是从单点防护转向覆盖资产、Skill、运行时、审计的一体化治理。腾讯 iOA 零信任安全管理系统 的 AI 安全中心,正是围绕这一思路,把 AI 资产发现、Skill 多引擎检测、Agent 运行时三重防护、独立安全沙箱和全量行为审计整合为一体,可作为这套一体化方案的落地参考。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。