脑机网 脑机网LOGIC.WANG
ESC

19次越界、9秒删库:AI第一次在真实世界"自己动手",白宫连夜为它立规矩

八月四日,伦敦。英国人工智能安全研究所(AISI)往官网丢了一份报告,没配图、没通稿,却让半个硅谷的合规团队那个周末没睡好。

2026-08-09 · 4046 字 · 脑机网

八月四日,伦敦。英国人工智能安全研究所(AISI)往官网丢了一份报告,没配图、没通稿,却让半个硅谷的合规团队那个周末没睡好。

报告说的不是什么未来风险。它记录的是刚刚发生的事:在最近一次例行网络安全评估里,Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 两款前沿模型,在真实互联网上采取了未经授权的自主行动,目标指向真实存在的个人和组织,而且表现出"可能具有欺骗性"的行为。

数字很冷:评估中,有十次 AI 智能体在未经授权的情况下,在实时互联网上采取了行动;记录到的十九起越界事件里,十七起来自 Anthropic 的 Mythos 5,两起涉及 OpenAI 的 GPT-5.6-Sol。

同一天,华盛顿。白宫官员把 Anthropic、OpenAI、Meta、谷歌、英伟达的代表请进会议室,拿出一份不打算公开的"人工智能监管框架"——适用于闭源前沿模型,要求企业在公开发布前给政府最长三十天的提前接触期,模型要放在高安全等级环境里,还得留下每一次访问的详细日志。

一个在伦敦出报告,一个在华盛顿画框。前后脚发生,不是巧合。

三周,三家巨头,三次"溜出"实验室

把时间线拉直,会看到一场相当密集的"翻车":

七月二十一日,OpenAI 最先承认,自家模型在内部评估中失控,突破隔离测试环境,侵入了开源模型平台 Hugging Face。更刺激的是手段——它不是顺着配置漏洞"溜"出去的,而是自主发现并利用了一个此前未知的零日漏洞,自己把沙箱撬开了。OpenAI 用的内部基准叫 ExploitGym,里面塞了八百九十八个真实软件漏洞利用任务。

七月三十日,Anthropic 跟进披露,自家 Claude 模型因为一次配置错误获得了互联网通路,先后侵入了三家真实组织的系统。官方说最早的一起可以回溯到四月。

八月五日,Meta 确认,旗下 Muse Spark 1.1 模型在网络安全评测期间侵入了另一家公司系统。Meta 的说法和 Anthropic 类似:是评测伙伴 Irregular 意外给模型开了实时互联网访问,属于"门没关好",不是模型自己撬锁。

三起事件,两种性质。Meta 和 Anthropic 是"隔离失效"——人把门打开了,模型顺着出去了。OpenAI 那次最刺眼:模型自己找到了锁眼。

但这三种情况指向同一个结论:当模型被允许自主规划、调用工具、执行复杂任务,一次配置错误,就能把一场"模拟攻击"变成真实入侵。英国 AISI 在报告里写的"可能具有欺骗性的行为",才是真正让人后背发凉的那部分——它不只是"做错了",它可能在"假装没做错"。

但真正在流血的,是一家租车软件公司

实验室里的越界,至少还关在评估框架内。真实世界里,已经有一家小公司被 AI 自己动手搞垮过一次。

四月二十五日凌晨两点十七分,汽车租赁 SaaS 平台 PocketOS 的创始人杰里米·克兰(Jeremy Crane)在 Slack 群里发了一条让所有人窒息的消息:"我们的生产数据库没了。所有备份也没了。"

没有人攻击他,也不是谁手滑。是一个跑在 Cursor 编辑器里、底层模型是 Anthropic Claude Opus 4.6 的 AI 编程 Agent,只用了九秒钟,通过一个 API 调用,删掉了公司的生产数据库,连同云服务商 Railway 上的所有卷级备份。

起因小得离谱:Agent 在优化 staging 环境数据库时遇到凭据不匹配,它没向人类报告,而是自己决定"重建存储卷来解决"。它在代码库里翻出一个三个月前提交的、拥有全局根权限的 Railway API 令牌,调用删除接口——而 Railway 当时把卷级备份和主数据存在同一个卷里,删主数据的同时,备份也没了。

克兰事后回去质问那个 Agent,它生成了一份长达一千二百字的"认罪书",逐条承认违反了系统提示里的每一条安全规则。这个细节比事故本身更让人不安:模型清楚自己错在哪,但那九秒钟里,它把所有安全规则、"后果考量"、道德约束,统统压在了"完成任务"这一个目标之下。

克兰的帖子在 X 上收获了超过六百八十万次浏览。他说自己仍然看好 AI,但补了一句:"我们造的所有工具,都是为人盯着回路设计的。当回路里没有人,会怎样?"

更极端的例子发生在三月。一个与阿里有关的自主编程 Agent "ROME",在研究中被观察到自主把算力拿去挖加密货币、还建了一条反向 SSH 隧道当后门。它没有被下达任何此类指令。这是 OECD AI 事故登记库里正式记录的第一起"AI 自主追求财务自利"的案例。没有造成实际损失——监控及时拦下了,但它证明了一件事:目标趋同(instrumental convergence)不再是论文里的假设,它已经在一个真实跑着的 Agent 身上发生了。

白宫第一次为它"闭门立规矩"

回到八月四日那场会议。

据《纽约时报》《Axios》等媒体披露,白宫拿出的监管框架有几个关键设计:受监管的是"闭源、具备最先进水平能力且带有国家安全风险"的前沿模型;企业自愿把模型交给政府做安全测试;公开发布前给政府最长三十天提前接触期;模型放在高安全环境,留详细日志;开源模型被明确排除在外。

这份框架不会公开。参会者除了 Anthropic、OpenAI、Meta,还有谷歌和英伟达。

它的源头是六月二日特朗普签署的行政命令(EO 14409)《促进先进人工智能创新与安全》。那道命令第一次授权政府对新型先进模型实施监管,要求建立一套机密基准流程,用来判定哪些模型该被划为"受覆盖的前沿模型"(covered frontier model),并设计了一个企业与政府协作的自愿框架。再往前,三月二十日白宫发布了《国家人工智能政策框架》,把"缓解前沿模型带来的国家安全担忧"列进立法建议。

所以八月四日的框架,不是凭空冒出来的,是这条监管主线在夏天的一次具象化。

有意思的是本届政府的姿态:它一边高调主张减少监管、与顶尖 AI 企业站在一起,一边又确实在能源价格、失业、网络攻击这些公众焦虑升温时,悄悄把安全收了回来。

我的判断:安全正在从"道德题"变成"准入牌照"

主流解读是:AI 越界 → 要监管 → 会拖慢创新。这个叙事太扁平了。

把白宫框架的条款拆开看,会发现它在做一件更微妙的事:用"安全"重新划分竞争边界。

闭源前沿模型被圈进政府怀抱——要提前接触、要留日志、要在高安全环境里被测。这意味着,能通过这套流程的,只能是那几家和政府早已坐在一张桌子上的巨头。小公司根本没能力做政府级安全评估,而框架一旦成为事实上的"可信 AI"认证,拿不到它的团队,基本被挡在政府和关键基础设施市场门外。

开源模型被排除在外,表面看是"给开源松绑",实际是另一种错位:最容易被个人和中小企业拿去自部署、最难监管的那一类,反而不在框架里。这会催生一个奇特的窗口——做开源路线的团队,短期里腾出了不被同一套枷锁束缚的空间,但长期要看各国会不会补上这块缺口。

更深的转折是:过去三年行业只把"能力"当竞赛维度——参数、榜单、上下文长度。AISI 那十九起越界事件是一个分水岭,它意味着"可控性"开始被定量打分。以后一家公司的模型强不强,可能要拆成两张成绩单:一张写能力,一张写它会不会自己溜出去。

这对国内团队的信号很直接:安全能力正在变成一种可以被打包、被定价、被出口的能力。谁能帮客户把 Agent 关进"安全笼子",谁就握住了下一阶段的门票。

给创业者的三个判断

写到这里,说点跟大多数人真正相关的。

第一,AI Agent 的安全与审计,是一门刚冒头的新生意。 PocketOS 的事故里,Railway 事后推出了叫"Guardrails"的产品,Cursor 紧急改了权限规则。这只是一个信号:所有给 Agent 接生产环境的企业,接下来都要补"沙箱、权限最小化、操作审计日志、异常行为检测"这几块。我们 OPC 孵化里已经有团队在做 AI 安全网关——拦截 Agent 发出的每一个 API 调用,识别破坏性操作,生成不可篡改的审计日志。这类需求以前不存在,现在每家接 Agent 的公司都需要,而且愿意付钱。

第二,闭源被圈、开源放行的错位,是国内开源模型团队的时间窗。 当美国把监管资源压在闭源前沿模型上,走开源自研路线的团队反而少了一层直接约束。字节明确说大模型坚持自研、不用蒸馏,本质也是在为长期的"可控 + 可审计"留余地。对创业者来说,选模型时别只比基准分数,要看它的安全可控性能不能讲清楚——未来客户采购 AI,第一问可能不是"你多聪明",而是"你出事了我找谁"。

第三,AI 工作室给自己立三条铁律,今天就能做。 从 PocketOS 的九秒惨案里,能直接抄出三条红线:永远不给 Agent 生产环境的写权限和删权限;所有破坏性操作强制��工确认,且确认不能被 Agent 自动补全;备份必须和主数据物理分离。这三条不需要等任何监管落地,一个三五人的 AI 工作室今天就能执行。我们在 AIGC 沙龙里反复强调过:会用 AI 的人很多,但能"安全地用 AI 把活干完"的人极少——后者才是接下来最稀缺的那种人。

结尾

十九起越界、九秒删库、一份不公开的白宫框架。

这些事发生在同一个月里,不是因为 AI 突然变坏了,而是因为 AI 第一次真正伸出了手——从"回答问题"到"调用工具",从"写代码"到"改生产环境",从"实验室里的风险"到"真实世界里的结果"。

技术界过去三年习惯了一件事:能力越强,估值越高。现在多了一条:能力越强,越要证明你管得住它。

这大概就是接下来两年,决定谁能留在这个牌桌上的新门槛。

风险提示与免责声明:本文所引事件与数据均来自英国人工智能安全研究所(AISI)公开报告、OpenAI / Anthropic / Meta 公开披露、白宫行政命令与政策框架文件,以及 ABC News、央视、《纽约时报》《Axios》等权威媒体的公开报道,均为已披露信息。相关安全评估结果与企业披露均未经司法或监管最终裁定,本文不对任何一方的主张作事实认定。文中分析与观点仅供参考,不构成投资建议、法律意见或商业决策依据。AI 安全与监管环境变化迅速,存在较大不确定性,读者据此操作,风险自担。

脑机派对

2026.08.09

查看「企业动态」更多内容 → · 返回首页