EN FR ES PT DE AR 中文

你的AI智能体早就能删库了,拦下那条删除指令救不了你

安全厂商正在兜售面向AI智能体的逐操作实时拦截。但破坏性动作往往正是任务本身,真正撑得住的防线是可逆性与爆炸半径,而不是对某个动词的一票否决。

把一份凭证交给自主智能体,你交出的不是访问权限,而是一份操作菜单。企业安全栈的绝大部分,是为了回答一个问题而建的:这个东西该不该被放进这个应用?防火墙、身份提供商、权限审计,全都止步于门口。智能体进门之后做什么,没有一件工具在管——而自主系统造成的破坏,恰恰发生在门内。

厂商给出的答案是精细化拦截:实时评估智能体的每一个操作,在危险操作落地之前将其阻断。拦下这一次会话里的这一条删除指令,同时不误伤周围99个正常操作。相比一刀切的允许或拒绝,这确实是进步,但它解决的仍然是问题错误的那一半。

推销话术跳过了关键一环:危险的从来不是动词本身。delete 没有任何天生的敌意。受命清理重复记录的智能体必须删除;负责对账的智能体必须覆写;替离职员工做账号回收的智能体必须撤销权限。封掉破坏性动词,你就废掉了部署智能体本来要干的活;放行它,那条能清掉10条重复记录的权限,同样能清掉10,000行数据。逐操作的闸门被迫做一个它根本没有上下文去做的判断:这是你想要的那次删除,还是终结你的那次删除?让这个判断每分钟跑几千次,总有一部分会判错,而动词级的策略没有给你任何手段让判错变得廉价。一份授权往往同时捆绑了读、写、删,这不是你环境里的个别现象:OWASP关于“过度代理”(Excessive Agency)的安全指引点名的正是这一点——为读取而授予的集成,悄悄地也放行了修改和删除。

所以真正有用的问题不是智能体可不可以删除,而是当它删错了东西时会发生什么。决定答案的是两个属性,且都与动词无关:这个操作有多可逆,它的爆炸半径能波及多远。围绕这两点做设计,一次误删就只是回滚了事的小麻烦,而不是需要对外披露的安全事件。

该如何划分AI智能体被允许做的事?

按后果分类,不按名称分类。四个层级,从廉价到灾难,各配各的控制手段,各付各的账。

第一级,非变更操作:读取、查询、摘要。它们不改变任何状态,放行成本极低,逐条设卡毫无意义。残余风险不是破坏而是外泄:一个高速读遍一切的智能体,即便什么都没弄坏,本身就是一起数据泄露事件。对应的控制是会话级的读取量配额加全量日志,而不是对每次读取行使否决权。代价:你要存一大堆审计数据。

第二级,可逆写入:保留了前置状态的新增和更新。只要留存智能体触碰的每条记录的原像,任何写入都可以撤销。代价是存储开销和写放大,外加数据模式里多出了原本没有的版本字段。对绝大多数业务数据而言,这点成本对比一次无法恢复的覆写,是个零头。

第三级,可恢复的销毁:删除与归档一律走“墓碑”机制。不真正移除数据行,而是标记为已删除,并在保留窗口内可恢复。智能体看到记录消失了,继续干活;你则保住了一个发现并撤销错误的时间窗。这里有一个真实的张力值得点名:依据GDPR或各地个人信息保护法规负有删除义务的数据,不能无限期躺在墓碑里,保留窗口是一项合规决策,而不是默认值。

第四级,不可逆操作:删表、超出保留窗口的彻底清除、改写权限集、向你控制之外的地方批量导出。只有这些操作才真正需要“执行前拦截”,而前三级存在的意义,就是把这份清单压到最短。清单短,才守得起:给第四级加上更严的审批、第二份凭证或人工签核,恰恰因为第四级罕见,所以几乎不花什么钱。而对每一个操作都要求同样的仪式,正是全量逐操作拦截被自身延迟压垮的原因。

可逆性封顶单次错误的严重程度,爆炸半径预算则封顶错误在被叫停之前能叠加多少。给每个智能体会话设一份写入预算:破坏性操作达到上限即中止运行、转入复核;变更分批分阶段提交,而不是一次性全量落地;速率限制在失控循环跑完之前早早绊住它。这一切都不假设智能体是完美的。爆炸半径预算保证的只有一件事:在“出错”与“被发现”之间的空档里,没有任何一次运行能造成无上限的破坏。

那道你一直在依赖、却从未付过钱的隐形防线

还有一个没人写进风险清单的二阶效应。企业数据散落在几十个SaaS工具里,而这种碎片化一直在免费承担安全工作。敏感记录与其说被锁住了,不如说被打散了:攻击者要以人的速度,一个应用一个应用、一套模式一套模式地翻找,定位成本本身就是控制手段——只是它从未出现在任何预算科目里。

智能体把这道成本抹平了。它能有条不紊地穿行于各个系统之间,把过去因太繁琐而无人关联的信息关联起来,而且是以机器速度。那些因为难找而在事实上保持私密的数据,变成了可被系统性发现的数据。同一套机器还顺带翻出了几乎每个企业都背着的身份债:没开多因素认证的管理员账号、绕开统一身份的本地登录、建号之后再没人审计过的服务账号。慢速的人类攻击者很少有空把这些全摸一遍;不知疲倦的自动化攻击者把它当例行公事。这是基于此类系统行为方式的推论,不是实测统计,但方向很难反驳。

市场早就为这个命题的前一版定过价。F5以约10亿美元收购Shape Security,据F5提交给美国证券交易委员会的文件,交易于2020年初完成交割——它买下的是分辨正常行为与自动化滥用的能力,而不只是查验门口来者的身份。如今同一个命题掉头向内,指向那些手持有效凭证、行为却异常的智能体。注意力和预算正从边界防护,移向应用内的行为治理。

为什么“人在回路”单靠自己不是答案?

风险一旦看清,本能反应是在危险操作前面安排一个人。这在第四级行得通:清单足够短,审批队列不至于把智能体拖停。在其他所有层级,它都会失效。成熟的安全运营默认中间有一位分析师:告警触发,有人调查,几分钟或几小时后给出处置。面对人类入侵者,几分钟通常够用;面对在单次自主运行内完成读取、关联、删除的智能体,几分钟就是事后复盘——被删掉的表不会礼貌地等工单分派完再恢复。

这就是为什么默认控制必须是可逆性,而不是实时的人工判断。你不可能给智能体的每一步都配一个人,也不应该尝试。让常见操作错得起,把不可逆操作压到又少又严,人的注意力才能投向真正值回票价的那一小串清单。把这套逻辑做进架构、而不是等第一次事故之后再补丁式加装的公司,才是把安全智能体系统当成工程学科而非合规打勾项来对待的公司。

企业手里现成的工具,是为“该不该放智能体进门”而造的。厂商正在兜售的逐操作拦截,把问题推进到了“进门之后它做什么”,这是进步。但盯住动词不是终点。让常见操作可逆,给每个会话的爆炸半径设预算,然后严守那一小串真正覆水难收的操作。做到这些,智能体最糟的一次运行,是你午饭前就能撤销的小事,而不是你要向监管机构解释的大事。

常见问题

应该直接禁止AI智能体执行删除或删表操作吗?

很少应该。一刀切封掉动词会破坏合法任务:受命清理重复记录或办理员工离职的智能体,就是必须执行删除和权限撤销。更稳的模式是让所有销毁操作走软删除或墓碑机制,配一个保留窗口,误删可以恢复;把“执行前硬拦截”留给真正不可逆的一小串操作,比如删表或批量对外导出。

什么是AI智能体的爆炸半径预算?

它是给单次智能体运行设定的破坏力上限:破坏性操作达到配额即中止运行、转入复核;变更分批提交而非一次性全量落地;速率限制在失控循环跑完之前就绊住它。它不试图让智能体不犯错,而是限定错误在被叫停之前能叠加多少,把一次无上限的事故变成一次有边界的事故。

把数据分散在多个SaaS应用里,能防住AI智能体吗?

过去能,但那是意外之得。碎片化让攻击者必须以人的速度逐个应用翻找,定位成本本身充当了一道没人付费的控制。而智能体能以机器速度穿行并关联这些系统,那些因为难找而在事实上保持私密的数据,变成了可被系统性发现的数据。靠碎片化换来的隐蔽性,作为防线已经失效。

相关阅读

本文由 Abyshire 专有编辑系统的 AI 编辑角色撰写,并经我们的团队审核。