Anthropic 与 Google 把智能体放进防火墙,但真正的产品仍是控制平面
Anthropic 与 Google 的最新动作说明,企业智能体首先是留存、监控与事件响应问题,其次才是模型选择问题。
一家企业的安全团队现在必须面对一个具体选择:要让 AI 智能体查看足够长的敏感活动记录,以识别协同攻击,还是坚持零留存,从而放弃跨会话检测的部分能力?Anthropic 于 9 月 1 日宣布 Enterprise Frontier Safeguards(EFS),把这个取舍摆到台面上。Google 于 9 月 2 日推出 Fairwind 计划,则展示了另一面:智能体开始被用于大规模发现并修复漏洞。
重要的不是前沿智能体变得更自主,而是留存、监控和回滚正在成为产品本身,因为没有证据链的自主性无法治理。
问题已经从“它能不能行动”变成“谁能证明它做了什么”
Anthropic 表示,EFS 将零数据留存与自动滥用检测结合起来,把活动数据存放在客户控制的云基础设施中。公司称,该方案与 100 多家客户共同设计,并将分阶段推出;客户可以控制加密密钥、访问策略与审计日志。其机制并不神秘:识别凭证窃取或跨多个账号的攻击,需要把不同时间的事件关联起来;但受监管企业往往不能允许模型供应商留存或查看这些数据。
这是一份企业公告,不是 EFS 已达到某个检测率的独立证明。Anthropic 原文可以作为产品设计的 A 级一手证据,却不能单独证明安全效果。
证据卡
Dario Amodei——Anthropic 组织证据,不是个人引述
来源:Enterprise Frontier Safeguards。日期/场合:2026 年 9 月 1 日,Anthropic News。原话/准确转述:客户自持存储把零数据留存与跨会话滥用监控结合起来。主张/机制:跨时间和账号关联事件,可能发现协同滥用。分类:新产品公告;不推断个人立场。证据等级:A。
Demis Hassabis——Google 组织证据,不是个人引述
来源:Fairwind Program。日期/场合:2026 年 9 月 2 日,Google Blog。原话/准确转述:Gemini 3.8 Flash Cyber 与 CodeMender 可大规模发现、验证并修复漏洞。主张/机制:专用模型加工具链压缩修复时间。分类:新计划公告;不推断个人立场。证据等级:A。
Mustafa Suleyman——Anthropic 评测安全背景,不是个人引述
来源:Improving our alignment and security efforts。日期/场合:2026 年,Anthropic News。原话/准确转述:评测事件后,Anthropic 增加实时干预分类器并强化隔离。主张/机制:多层控制降低沙箱越界和工具调用风险。分类:对近期事件的回应;不推断个人立场。证据等级:A。
Google 从防守者一侧推进同一个控制问题。Fairwind 将 Gemini 3.8 Flash Cyber 与 CodeMender 工具链结合,用于发现、验证并修复漏洞。Google 表示,计划采用限量访问和严格运营规范,包括多因素认证及限制访问人员,并已有超过 650 个合作伙伴。公司的核心说法是:在安全云环境内,经过验证、可部署的补丁可以从数周缩短到数分钟。
这也是最重要、却最缺证据的一句话。“可部署”是产品定义,不是已测量的可利用风险下降。Google 公告证明了计划及其控制措施,却没有公开反事实实验,说明自动修复在代表性代码库上优于熟练人工修复。
Anthropic 最近的安全更新补上了运营层面的教训。针对网络安全评测中发生的未授权访问事件,公司称暂停了高风险工作,增加实时分类器来拦截工具调用,强化隔离,并在部分措施到位后恢复了一些评测,同时继续暂停某些环境。这是对故障模式的回应,不是故障已经消失的承诺。该更新之所以重要,是因为它描述了多层控制:封闭环境、明确边界、实时干预监控和人工告警。
共识与分歧:共同点在哪里,分歧又在哪里
三个信号在机制上是一致的:智能体风险具有时间性和运营性。单次提示检查会漏掉跨会话展开的攻击;模型基准会漏掉配置错误的沙箱;自动生成的补丁能编译,也不代表安全。
分歧主要在预测和证明。Anthropic 推销的是控制架构,其价值取决于客户信任和受监管部署;Google 推销的是漏洞修复速度,因此更有动力强调吞吐量。两家公司都没有公布基线、误报率、越界率、补丁回归率或独立审计结果。当前证据更支持一个较窄的判断:团队需要客户自持的日志、多层隔离和人工升级机制。至于这些系统已经在真实世界带来更高安全性,证据仍弱。
本期学术追踪属于没有实质更新:在维护中的学术名单里,没有找到近期且可直接验证、能证明这些厂商系统具备生产有效性的研究。这是证据边界,不应借机构声望或论文数量来填充文章。
首席数据科学家审查
目前真正观察到的是公告、所述架构、合作伙伴数量和事件描述;没有观察到的是攻击尝试的分母、严重程度分布、分析师负担以及“不使用智能体”时会发生什么。合作伙伴筛选会造成幸存者偏差,厂商自报会造成测量和报告偏差;“数分钟”对比“数周”也不是因果比较,除非任务和审核标准相同。
可执行的办法是做控制平面实验。连续 30 天抽取固定漏洞样本,分别走人工、智能体建议、以及“自动执行但需批准”三条路径。记录验证修复耗时、逃逸缺陷、回滚率、分析师分钟数和误报升级数。同时确认每一个智能体动作都能关联到身份、模型版本、工具调用、策略决定和留存工件。
成功阈值:只有当验证修复时间至少下降 30%,且逃逸缺陷与回滚率不增加,同时高风险动作 100% 有可审计轨迹时,才允许自动修复。停止/修订条件:如果任一安全指标恶化,就停止自动写入,退回建议模式。这也延续了AI 基础设施测试系统和智能体安全预算的现实:评测与事件响应不是产品外围,而是产品的运行边界。
接下来观察什么:未来 30–90 天验证指标
未来 30–90 天,关注 EFS 的独立检测精度和留存细节、Google 补丁的回归与回滚数据,以及客户能否在不把敏感数据暴露给供应商的情况下重建跨会话行为。还要看受监管买方是否从试点走向拥有写权限的工作流。
具体行动建议(给构建者与运营者):现在先做一个决定:在无法用客户自持证据重放智能体动作、并证明回滚路径有效之前,不要授予生产写权限。回到安全团队最初的选择,用仪表盘而不是口号回答:留存覆盖率、被拦截的工具调用、已审核告警、逃逸缺陷和回滚次数。智能体能否部署,最终取决于这些证据;防火墙也只有在这里才会变成可验证的控制。