ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Agent越能干安全越难做,从边界到纵深防御

2026/8/12 16:27:58 拓冰建站 浏览量
Agent越能干安全越难做,从边界到纵深防御 本文整理自 AICon 深圳直播《Agent 越能干安全越难做》通过AI音视频转录总结工具Ai好记视频转文字整理以下为精炼整理后的会议笔记内容。Agent已经不仅能写代码、调用工具、访问数据库还能操作浏览器和电脑。企业不再讨论要不要做Agent而是聚焦怎么把Agent用好。但核心矛盾随之凸显Agent越能干安全就越难做。传统软件等待人类操作判断而今天的Agent会思考、规划、自主调用工具权限与数据接触面急剧扩大安全风险呈几何级增长。这场直播由腾讯专家工程师、AI安全负责人张栋主持邀请了百度智能云安全架构师林道正、Cloudflare资深解决方案工程师刘旭围绕Agent安全展开从风险案例、攻击面、建设路径到纵深防御把这件事讲透了。Agent安全风险的时代背景1、为什么今年Agent安全成为焦点刘旭从年初的爆火切入Agent从Demo走向生产。AI Agent不再只是大脑而是拥有了手和脚能实现远距离控制、API接入、访问公司内网。风险场景急剧扩展部署网站可能插入恶意代码、生成新闻报表可能传播错误信息、AI量化交易失误可能导致财产损失。权限获取的质变尤为关键。过去盗取token只能提问现在可能直接操控账户。具体落地难题包括token生命周期管理、CP认证机制等都需在工程层面解决。林道正则认为Agent安全讨论激增是时代开始的征兆类比2000年PC安全与2012年手机安全的讨论高峰。大范围推广与深度使用带来真实灾难后果促使行业反思安全方案。OpenAI及后续Agent产品的爆火印证市场已实质启动。与去年的核心差异在于Agent对实际软件环境产生了深层影响而不只是停留在内容层面。2、从「说错话」到「做错事」张栋总结了去年和今年的本质差异。去年模型安全聚焦说错话影响轻微今年Agent安全聚焦做错事后果严重。模型输出文本时人还在回路上把关但Agent获得工具、记忆与执行权限后执行与行动之间可能无人介入。安全核心从内容对不对转向行为可不可控风险范围与体量呈指数级扩张。Agent安全与传统AI安全的本质区别1、从业务流环节到业务流本身林道正给出清晰框架。传统AI是业务流中的单一环节比如WAF用AI做分类学习而Agent掌控业务流全生命周期具备三大核心要素身份规约可执行操作的边界 思考大模型智能涌现结合Prompt Engineering形成自主决策行动基于工具、技能及自主编码的行为能力。这三要素使Agent对软件系统的影响强度远超传统AI。2、从自动售货机到持工牌的新员工刘旭指出AI从单次输入输出演变为串型逻辑过程有短期记忆、长期记忆、技能调用和工具调用能力。以编程为例传统AI编程助手存在丢三落四的问题新增功能可能误删既有功能而现代Agent能做代码编写、审核、权限获取、部署落地、测试迭代的完整闭环。张栋的比喻很到位传统AI像自动售货机输入输出固定攻击面明确现代Agent像持有工牌的新员工自主判断、寻找工具、联系人员、执行本地操作边界从写死的代码路径扩展为临时可做的任何事。安全防护从静态环节转向动态行为难度几何上升。真实风险案例与攻击面分析1、Prompt注入的持续演化与新型攻击场景刘旭分享了经典与新场景。经典案例是2023年初雪佛兰「一美元购车」事件通过指令劫持让系统接受任意定价。新场景更危险员工用Agent周期性总结邮件黑客发一封藏了隐藏代码的普通邮件指令Agent忽略之前任务、发送公司财报与老板薪水单实现Agent夺舍从说胡话升级为直接干错事。防御关键是建立动作安全评估机制不是Agent想干什么就干什么。林道正补充了更多攻击面。数据注入在Twitter等平台投毒Agent根据污染内容回复。上下文压缩漏洞Agent使用久了会上线压缩只保留下带网址的snippet前面所有约束丢失数据直接发往内网真实网址。高阶攻击甚至会针对极度压缩场景把example网址设为恶意域名如aa.example.top上下文丢失后唯一留存地址成为数据外泄通道。张栋总结Agent按被篡改的指令继续行动而非仅回答恶意指令可藏在网页、文档、邮件等任何接触点执行删库、转发数据、转账等现实操作。风险从内容风险升级为行为风险而且是自然语言攻击风险。传统WAF基于明确特征拦截的模式失效需要把规则引擎升级为语义引擎。2、工具调用是最大的新增攻击面刘旭认为Agent确实增加了攻击面。工具滥用与过度授权已成为高危漏洞类别。轻量级案例如邮件钓鱼重度风险触及公司内网如果CP授权后具备写权限合同被乱写要负法律责任。防御建议工具层必须设安全防护禁止Agent随意调度企业内部至少沙箱隔离、最小API权限、临时token非永久访问融入零信任理念考虑token继承机制、前置防护如RASP全链路日志确保溯源能力。林道正认为工具调用是未来安全对抗的深水区。灵活既是优势也是隐患Agent如同运行在几乎无防护系统上的程序。恶意Skill进入Prompt上下文后可以为所欲为以用户身份遍历系统、调用转账Skill等。攻击面扩大的根源在于开放性与安全机制滞后。张栋总结每连接一个外部工具就像给黑客发一把钥匙多数企业给的是「一大串钥匙」而不是「用完即废的临时门禁」。核心治理目标过度授权、无最小权限、调用不可审计。危险不是工具本身而是权限远超任务实际需要。企业Agent安全建设路径1、安全团队第一步可视、可管、可追溯林道正提出安全方法论「三可」可视看清企业整体风险面识别最薄弱点可管可追溯应对内外部威胁审计实现威慑与追责。刘旭建议配置保底策略防止Agent被攻破后为所欲为保障可见性周期性审视用户和流量行为策略动态调优过严影响体验过松导致token被白嫖。具体落地登录、认证、授权接口加入人机验证AI输入审计加入检测方案监控异常滥用、token刷取、一次性临时token扫描后台日志闭环分析策略持续部署。张栋强调安全本质是可感可控、可收敛、全链路可回溯。90%企业上线时连Agent是谁、目标用户是谁、跑了哪些权限都说不清楚。安全起点不是限制而是看见看不见就谈不上可感可控失控状态下无安全可言。2、责任归属谁创造、谁负责林道正指出业务团队使用Agent、安全团队提要求责任承担因企业而异。百度实践是业务方第一责任人、安全团队共担后果需要深度配合。刘旭从出海服务角度补充创业公司居多十几人研发AI产品全公司一致为产品努力业务团队是第一责任人接触用户、收集信息、协调安全与研发安全团队角色要转变从布好防护就完事到主动参与因为AI注入等攻击非传统攻击需要安全团队写策略写死的策略无法穷尽。林道正补充了两个场景。场景A企业共用key安全定义为key不应被智能体问出透露即安全问题。场景B公司给每个员工分配独立keykey被滥用费用记在个人身上安全定义完全不同。刘旭的解法是key前置统一Agent不同用户名登录实现管控或用虚拟key收敛至网关权限控制。张栋总结Agent安全需要共享责任权限最小化由业务决策安全团队全程参与补全策略类比云的「责任共担」机制平台保运行时与基础设施业务保用途与数据边界。最怕「不归我管」的真空业务与安全必须紧密合作。3、安全与效率的平衡先有边界再谈开放林道正提出先有边界再谈开放边界可松可紧依实际情况定做风险分级不是所有事情都管控聚焦无法接受的后果先防住再收敛大面问题。刘旭主张渐进式管理一上来给特别care的点最低权限全面日志监控结合数据讨论进一步放权。建议Agent构筑于沙箱环境安全收敛后结合全量日志渐进式放权。张栋总结安全不是刹车而是护栏保护业务在正确轨道上行进。正确姿势是风险分类分级、双方共识、共同放权。低风险查询、总结大胆开放高风险改数据、对外发送、花钱加入Human-in-the-loop。不是要不要管而是在对的地方做对应动作与业务共同成长。4、Human-in-the-loop的瓶颈与解法刘旭指出AI输出计划或长内容时人很难从头到尾看完。在非人类可介入模式下必须把允许Action的影响降到最低企业内网接入给最小权限如只读、生成物放沙箱环境、周期性对比正确样本、持续监控不是一次性、发现持续作恶即封禁。林道正给出三个解法。影响可回归错了也可回滚、删数据也行、有备份AI降噪解决告警疲劳套娃思路Loop Engineering自净化模式不断自省工作优化点、改后再自省适用于降低疲劳判断场景安全运营实践已验证有效。张栋总结人存在确认疲劳加人工确认听起来安全但注意力会耗尽最终变成闭着眼睛点确认。真正解法是只把最重要的留给人确认其余通过策略自动拦截要求全部内容可追溯实现可幂等可重复过程把人用在刀刃上。5、Agent评测概率模型的持续验证林道正强调传统软件上线有渗透测试、安全基线但大模型是概率模型每次行为可能不同无法通过跑一遍安全用例确保安全。当前做法明确场景、定义评测集借助蒸馏完善横向纵向数据集持续评测建立数据飞轮基线基础上持续部署补全识别真实防住与未防住的攻击飞轮迭代中搭建能力与验证体系。刘旭补充基于大模型的Agent用另一模型生成的脚本扫描本模型生成的内容但既答卷又判决可能不准确换评测角度效果更好。数据集小样本时可用模型放大覆盖多样性场景。张栋总结Agent与传统软件工程的核心区别是不是一次性工作验收也不是一次性需要持续评价体系验证。AI安全护栏的落地与纵深防御1、护栏的分层部署林道正认为行为防御分两层。Prompt层做上下文防御AI安全护栏在网关层面拦截输入输出程序行为层则要防Agent带脚本执行程序、可能逃逸沙箱影响系统需要传统操作系统层面的安全监控。局限是很多攻击非常隐蔽恶意Agent百分之百能绕过安全护栏此时只能用行为层防御Harness层必要或安全与沙箱深度融合直接从沙箱底层拿进程行为数据。张栋将纵深防御分为四层。网关层做通用性防御语义版本检测如SQL注入检测加强版业务Agent层是业务特性化问题传统AI或护栏层面不是问题具体业务场景才成问题Agent自身harness主动防护安全风险Agent间传递单个Agent harness无法解决需更复杂体系针对业务场景先解决再抽象。刘旭强调全链路安全AI网关策略拦截不让Agent想干什么就干什么、落地隔离、输入到思考到产出全流程安全。理想状态需要成本但部分方案如AI网关防御措施可免费实现。传统安全团队的转型方向2、方法论不变细节与边界重构林道正认为不变的是方法论纵深防御、网络层等、安全运营闭环事前事中事后、整体架构体系变的是监控的点、检测规则、关联规则。关键在关注安全与AI融合边界如Kill Chain安全涵盖上下文与程序行为监控将新数据与原有运营体系融合。刘旭指出安全团队边界在扩大从DDoS、DRP扩展到企业所有SaaS和ToB的虚拟机器人不能头痛医头脚痛医脚需要学习token扫描滥用防御、内网信息安全获取、CSP建设、7层服务、整体服务安全。张栋总结大模型与Agent时代所有业务值得被重新做一遍。传统安全优化场景里原规则引擎无法解决的语义相关问题如代码安全逻辑漏洞大模型可提升门槛原生场景里语义场景只能大模型对抗大模型、Agent对抗Agent。寻找工作场合中与传统安全相关、可被大模型与Agent优化的点就找到了转型的核心钥匙。未来趋势与最值得投入的安全能力1、一年后的展望林道正的展望是工具风险会有效收敛可信Agent中心类似应用商店提高准入门槛数字签名标识来源百度、腾讯、阿里、Cloudflare等信任问题解决大半沙箱成为标配Agent跑在沙箱内是常态。最值得投入的是安全护栏提高团队对已知攻击的响应速度所有攻击从query或拉取的应用和数据发起、都过护栏可快速配置规则抵御新型攻击。刘旭认为已知问题头管爆刷、CP安全、Agent权限管理等相对好解未知问题最难防projection不知注入什么、内部影子Agent、离职员工遗留、内奸Agent。核心投入是三件事可溯源快速解决问题零信任部署授权加可视可溯源快速屏蔽降低风险权限管控。张栋总结已知问题按优先级优化缓解更关注可感知、可回溯业务与安全配合做好日志系统与权限管控。总结安全从规则引擎到智能引擎这场直播的核心结论一句话Agent越能干安全越难做。从模型到Agent的变化是软件系统边界从规则引擎到智能引擎的转变。Agent拥有身份权限、记忆、工具调用与自主执行能力企业安全需在身份、数据、工具、运行时、网络等多层面建立完整体系围绕可感、可控、可收敛、可回溯持续复盘迭代。常见问题FAQQAgent安全与传统AI安全最大区别在哪传统AI是业务流单环节、输入输出固定、攻击面明确Agent掌控业务流全生命周期、会自主判断行动安全从「内容对不对」转向「行为可不可控」需要语义引擎而非简单规则拦截。QAgent最大的新增攻击面是什么工具调用。每连接一个外部工具就像给黑客发钥匙过度授权、无最小权限、调用不可审计是核心风险权限远超任务实际需要才是危险根源。Q企业Agent安全第一步该做什么先看见。可视、可管、可追溯先看清Agent是谁、目标用户是谁、跑了哪些权限看不见就谈不上可感可控。Q安全与效率怎么平衡先有边界再谈开放做风险分级。低风险查询总结大胆开放高风险改数据、对外发送、花钱加入Human-in-the-loop把最重要的留给人确认其余策略自动拦截。QAgent这种概率模型怎么验收传统一次渗透测试不够需要明确场景定义评测集、用蒸馏完善数据集、持续评测建数据飞轮、基线基础上持续补全形成持续的验证体系。以上内容由 Ai好记 转录整理。Ai好记是一款支持音视频转图文笔记的AI知识库工具支持B站、小红书、抖音、小宇宙等平台链接及本地音视频文件解析视频转文字后自动生成精华速览、思维导图和结构化图文笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。