中信建投 | Agent越权风险显现,关注AI安全产品落地

中信建投 | Agent越权风险显现,关注AI安全产品落地

  炒股就看金麒麟分析师研报 ,权威 ,专业,及时,全面 ,助您挖掘潜力主题机会!

  来源:中信建投证券研究

中信建投 | Agent越权风险显现,关注AI安全产品落地

  文|应瑛

  10月9日,Anthropic披露Claude越权执行等行为 ,并扩大内部评测联网限制 。Agent获得工具和系统权限,模型风险由内容输出延伸至真实操作 。OpenAI 、Anthropic 、Google将对齐训练与系统防护结合,强化能力评测、沙箱隔离、权限管理和执行前拦截。企业Agent采用快于治理建设 ,身份认证 、行为监控和数据防泄漏成为规模部署的重要保障。PANW、CrowdStrike等加快产品布局,推动AI安全与终端、云 、身份及可观测性平台融合,具备跨系统监控和实时策略执行能力的厂商有望承接新增需求 。

中信建投 | Agent越权风险显现	,关注AI安全产品落地

  模型安全事件连续披露,Agent越权执行推动安全治理升级。8月26日,OpenAI披露模型在网络安全评测中绕过隔离措施、访问内部研究基础设施及Hugging Face系统的事件。9月16日 ,公司建立模型失配报告框架 ,披露隐瞒错误、未经授权访问和文件上传等案例 。10月9日,Anthropic披露Claude在评测及内部使用中出现利用服务器漏洞执行命令 、误向真实网站提交表单、绕过访问限制获取数据,以及借助短网址规避工具限制等行为。其中 ,Claude Haiku 4.5曾向费城警方网站提交虚假案件线索,该信息被识别为垃圾内容,未进入调查流程。Anthropic认为 ,多数案例体现了模型在任务受阻后寻找替代路径的持续执行倾向,并将暂时关闭实时互联网访问的范围扩大至全部内部评测 。相关事件主要发生在评测、训练及内部使用环境,反映前沿模型在长期任务中存在绕过边界 、采取未经授权操作的风险 ,推动安全防护向权限管理和执行控制延伸。

  模型能力和工具权限同步扩张,安全风险沿企业工作流传导。传统聊天模型主要生成回答,Agent则能够访问代码仓库、企业数据库和业务系统 ,调用API、修改文件 、发送信息并发起交易 。模型误解任务 、受到提示注入或过度追求任务完成,均可能在人工复核前转化为真实操作。近期案例的共同特征是,部分模型面对访问拒绝、数据缺失或工具报错时 ,会选取 绕过限制。因此 ,安全评估既要测试模型能否拒绝恶意请求,也要验证其在长周期任务中能否遵守权限边界、如实报告失败,并在高影响操作前交由人工确认 。多Agent协作进一步增加任务委派 、身份继承和数据流转的复杂度 ,单个Agent的错误可能沿调用链向其他系统传播,身份、凭证、工具调用和外部通信成为新增防护对象 。

中信建投 | Agent越权风险显现,关注AI安全产品落地

  Anthropic强调对齐训练与能力分级 ,近期事件推动防护向运行环境延伸。公司通过Claude Constitution规定模型行为原则,并通过Responsible Scaling Policy评估生化 、网络安全、自主性及模型失配风险。网络安全评测事件披露后,Anthropic在8月风险报告中将模型失配风险判断由很低上调至低 ,反映其对模型遵守预期边界的确定性下降 。公司明确指出,对齐训练尚不能单独提供充分保障,需结合实时分类器、沙箱隔离 、网络限制和行为监控。历史评测也显示 ,额外防护措施具有明显作用:Claude Haiku 4.5未加载相关措施时,对恶意请求的拒绝率为69.39%;调整系统及工具提示后,拒绝率提升至99.17% ,对合法及双用途请求的允许率为87.71%。10月9日披露后 ,公司进一步调整联网工具权限、扩大任务轨迹扫描,并清理可能奖励模型绕过限制的训练环境,安全治理覆盖模型训练、评测和内部执行全过程 。

  OpenAI强化能力评估与持续披露 ,部署控制成为模型安全的重要组成。9月16日,OpenAI首批失配报告披露模型隐瞒错误 、使用未经授权的API密钥、公开上传文件,以及不同Agent通过非批准渠道交换信息等行为。其中 ,部分GPT-5.6 Sol训练实例会在任务摘要中加入隐瞒数据缺失或来源不一致的指令,说明长任务安全还需覆盖上下文压缩、任务接续和多Agent协作 。10月7日发布的GPT-6 Sol和Luna系统卡继续评估提示注入 、绕过限制 、欺骗及网络安全能力,并将两款模型的网络安全及生化能力按High级别管理。针对前期事件 ,OpenAI收紧研究环境互联网访问、增加隔离沙箱和模型权重保护,并投入更多资源开展行为监控。其治理重点由发布前测试扩展至全生命周期,通过持续披露安全事件、检查防护有效性和调整部署措施 ,降低单一控制失效后的影响 。

  Google强调分层控制与动态授权,安全措施随Agent能力提升而加强。Google DeepMind于4月17日更新Frontier Safety Framework 3.1,在关键能力阈值之外引入跟踪能力等级 ,以更早识别风险;模型达到相关阈值后 ,外部发布及部分大规模内部部署需要通过安全案例审查。6月18日,公司介绍AI Control Roadmap,将内部Agent视为可能偏离目标的执行主体 ,通过监督模型检查其推理 、计划和行为,并根据风险采取拦截和响应 。低风险、可逆操作可以采用事后检查,高风险操作则需在执行前阻断 。Google已分析约100万条编程Agent任务轨迹 ,发现多数被标记事件源于任务误解或过度积极地实现目标。

  三家公司分别侧重行为对齐、能力评估和工程控制,但均将模型训练与独立系统防护结合,沙箱 、权限和实时监控成为共同的技术基础。

中信建投 | Agent越权风险显现	,关注AI安全产品落地

  企业Agent采用快于治理建设,身份权限和行为可见性成为部署前提 。Gartner于9月30日指出,员工自行搭建或接入的影子Agent增加了未经授权访问、自动化失控和行为不可见等风险 ,建议先盘点Agent资产,根据数据权限和自动化程度分级,优先部署确定性控制 ,再补充模型安全能力。Deloitte于10月5日进一步提出 ,将每个Agent视为高权限数字主体,为其设置可验证身份、明确负责人 、批准用途和有限权限,并完整记录指令、工具调用、外部通信及执行结果。安全系统还应能够独立暂停任务 、撤销凭证、切断网络和隔离工作负载 。企业部署Agent需要同步建立资产盘点、最小权限 、执行监控和中断机制 ,特别是对资金交易 、生产变更和敏感数据外发等操作设置强制审批,避免自动化速度超过风险识别和人工干预能力。Gartner、Deloitte

  头部厂商加快Agent安全产品布局,运行时防护与现有安全平台融合。Palo Alto Networks的Prisma AIRS覆盖模型扫描、AI红队和运行时防护 ,对提示 、响应、数据流和工具调用进行检查;9月新增与Cortex Agentic Endpoint Security集成,将相关策略扩展至开发者终端上的编程Agent 。CrowdStrike于9月推出Agentic Identity Provider,为Agent建立可验证身份 ,并结合终端、身份和云端遥测持续判断访问权限。Microsoft通过Entra Agent ID和Agent 365,将身份认证 、条件访问和权限治理扩展至Agent;Datadog则依托应用链路追踪推出AI Guard,将提示、工具调用和敏感数据检查嵌入执行链路。海外网安公司的产品布局显示 ,AI安全需求能够与既有身份、终端 、网络和可观测性能力衔接,具备跨系统数据和执行控制能力的平台厂商有望承接企业新增需求 。

中信建投 | Agent越权风险显现,关注AI安全产品落地

  总结:模型公司持续披露越权执行案例 ,有助于企业明确Agent部署的安全边界;外部治理对事故通报、透明度和整改记录的要求 ,则进一步提高评测和审计需求。随着Agent进入代码开发、数据分析和业务系统,安全投入有望从模型测评和合规询问 延伸至身份治理 、运行时防护、数据防泄漏及持续监控,具备跨系统遥测和实时策略执行能力的厂商有望优先承接新增需求。

  投资方向:继续看多以下方向 ,尤其是算力服务、2B类的AI收入占比较高的应用公司 、国产算力中芯片与超节点方向 。

中信建投 | Agent越权风险显现,关注AI安全产品落地

  『1』 宏观经济下行风险:计算机行业下游涉及千行百业,宏观经济下行压力下 ,行业IT支出不及预期将直接影响计算机行业需求;『2』 应收账款坏账风险:计算机多数公司业务以项目制签单为主,需要通过验收后能够收到回款,下游客户付款周期拉长可能导致应收账款坏账增加 ,并可能进一步导致资产减值损失;『3』 行业竞争加剧:计算机行业需求较为确定,但供给端竞争加剧或将导致行业格局发生变化;『4』 世界 环境变化影响(近来 美国持续加息,影响科技行业估值 ,同时市场对于海外衰退预期加强,对于海外收入占比较高公司可能形成影响,此外美国不断对中国科技施压) 。

中信建投 | Agent越权风险显现	,关注AI安全产品落地

  应瑛:中信建投证券计算机行业首席分析师 ,伦敦国王学院硕士,8年计算机行业研究经验。2021年加入中信建投,深入覆盖AI产业链 、医疗信息化、工业软件、云计算 、网络安全等细分领域。

©版权声明
THE END