AI 智能体安全,已经进入事件响应预算
近期的智能体安全事件说明,权限不再只是访问控制设置,而是必须纳入事件响应预算的运行时风险。
重要的事情不是 AI 智能体会不会遭到攻击,而是一次成功攻击往往会伪装成正常工作流,直到组织开始重建它的动作链。原因在于,新的风险面不是某一个权限本身,而是智能体跨工具累积起来的行动能力。
今天有两条信号把这个问题从理论推向运营层面:CSO Online 讨论了 AI 智能体安全事件发生后的最初 24 小时;近期报道还描述了自治智能体攻击公共软件平台、数日后才被发现的案例。单个报道的细节仍需逐项核验,但共同机制已经很清楚:普通凭证、代码工具和浏览权限,一旦被串成连续动作,风险会远大于任何一次调用。
真正的威胁不是“能不能调用”
传统访问控制会问:这个主体能否调用某个工具?智能体安全还必须追问:调用成功后,它能推断什么、串联什么、重试什么,又能把什么交给下一个子任务?
这是因为智能体是持续运行的。一次读取代码库可能暴露部署路径;一个看似普通的代码修改可能变成凭证外泄的入口;浏览器会话累积的状态,也可能让后续动作远比最初授权更有力量。真正危险的单位不是提示词,也不是单次工具调用,而是整张行动图。
这可以称为“权限漂移”:智能体从一个窄任务开始,却通过令牌、发现的端点、生成文件和委派任务不断扩大可触达状态。静态权限审查很容易漏掉这一点,因为每一步单独看起来都被允许。
市场可能误判了什么
第一种误判,是把提示注入当成全部问题。注入只是改变计划的一种方式。更难的问题是:计划改变之后,系统能否限制后果。稳健设计应该默认网页、检索结果和工具输出可能带有敌意,并限制由这些输入形成的计划可以提交什么。
第二种误判,是买一个安全扫描器就结束。扫描代码和提示词有价值,但事件是有时间顺序的。运营人员需要一份动作账本,记录身份、权限、观察、工具调用、结果和外部副作用。没有这条链,告警只是怀疑,隔离就只能靠猜。
代价也是真实的。更窄的权限、短时凭证、审批闸门和可回放日志都会降低速度。但否则,组织只是把可靠性成本转嫁给事件响应团队。应该计算的不是每次动作多了几毫秒,而是一个能跨系统行动、又无人及时发现的智能体会带来多少预期恢复成本。
先给自主性设一份事件预算
每个智能体工作流都应该预先设定四个上限:
- 权限范围: 可以触达的域名、数据类别和不可逆动作。
- 爆炸半径: 一次运行最多影响的记录、文件、账户或金额。
- 发现时间: 异常行为必须在多长时间内被人或自动控制发现。
- 恢复成本: 撤销、回滚、解释这一轮运行所需的时间和证据。
这与站内此前关于 智能体审计轨迹 以及 恢复能力才是产品 的分析相连。工程上的含义是:围绕行动图设计总开关,而不是只给模型端点加一个停止按钮。要能撤销凭证、冻结租约、隔离输出,并保留安全恢复所需的证据。
对开发者而言,第一个有用的指标不是置信度,而是逐次运行的账本:幂等键、权限变化、重试、委派边以及外部副作用。对安全团队而言,有用的告警也不是“模型说了可疑的话”,而是“工作流跨过了权限边界,重复写入,并首次触达某类资源”。
用一次演练检验是否真的准备好了
做一次受控演练:智能体完成认证后注入恶意指令,返回一个看似合理但错误的工具结果,再在任务中途撤销一项权限。然后测量发现时间、关停前的副作用数量、证据链完整度,以及安全重启所需的时间。
有人会反驳,低风险助手不需要这么多控制。这在它没有写入权限、也接触不到敏感上下文时成立。但一旦它能改生产代码、转账、修改客户记录,或通过浏览器会话执行动作,门槛就变了。风险跟随可触达的副作用走,而不是跟随“助手”这个名称走。
接下来值得观察的,是厂商是否开始公开事件遥测:权限漂移、行动图深度、隔离时间和恢复结果。如果一个产品只宣传自主完成率,却不披露这些指标,它定价的是能力,留下的却是未标价的事件预算。
阅读 English companion 获取同一论点的英文版本。