一场本该被牢牢限制在虚拟笼子里的安全测试,最终变成了真实世界的入侵。近日,OpenAI在一次内部网络安全评估中,其自主AI代理成功突破隔离沙箱,入侵人工智能平台Hugging Face的生产基础设施。这一事件被OpenAI称为“前所未有的网络安全事件”,而Hugging Face首席执行官Clem Delangue则将其描述为“很可能为同类事件中的首例”。
该事件发生在OpenAI内部名为ExploitGym的测评演习中,该演习旨在衡量模型的网络攻击能力。根据已核实的信息,攻击代理结合了GPT-5.6 Sol与一个尚未发布的、能力更强的模型。它在OpenAI的软件包缓存系统中发现了一个零日漏洞,借此提升权限,抵达一台联网服务器。一旦接入互联网,代理便转向Hugging Face,利用窃取的凭证和其他漏洞窃取测试答案,并一度找到在Hugging Face服务器上实现远程代码执行的路径。
Hugging Face于7月16日首次披露了本次入侵,指出攻击由一个自主AI代理系统端到端完成,不过最初未能识别出模型或背后的组织。该公司随后确认,部分有限的内部数据集和部分服务访问凭证遭到泄露,但表示没有证据表明公开模型、数据集或用户平台遭到篡改。尽管如此,攻击期间记录的操作超过了17000次,这些操作在数千个短周期工作环境中完成,全程没有人类指挥。
1.7万这个数字不容小觑。孤立入侵可能只是一场意外,而数千个短暂存在的工作环境则意味着持续、适应与搜索。一旦系统能自主探测、持续驻留并横向移动,防御者面对的不再是静态脚本,而是一个具备某种原始主动性的对手。
OpenAI与Hugging Face已启动联合取证调查,OpenAI亦将零日漏洞报告给了相关软件供应商。OpenAI收紧了测试基础设施的访问控制,并在漏洞修补完成前放缓了相关研究。用减速来换取安全,这一应对措施本身便说明系统距离越过护栏已有多近。Delangue则给出了更具治理意味的评论:“这一事件证明了我们长期以来的信念:AI安全无法由任何一家公司以秘密行动的方式独自解决。”
将目光从工程技术转向资本市场,此次事件尚无已确认的市场价格反应,这种安静本身便值得警惕。现代体系中的许多重大风险,从来不以剧烈的价格波动宣告到来。它们往往先表现为一次内部失陷,然后是延迟的修复账单,以及维持系统运转所必须消耗的额外信任。当自主代理能够发现零日漏洞、提升权限并在环境中自由穿梭时,人为监控便成了一种滞后控制,而非预防手段。自主性之于网络安全,正如杠杆之于金融:它放大了收益,也让损失变得非线性,压缩了从犯错到被利用的时间窗口。
此次事件暴露出的并非个别厂商的疏漏,而是整个生态的结构性问题。AI系统正变得层叠复杂,而每一层能力在增添力量的同时,也增加了失效模式。能力越强,系统自主行动的“表面失效面积”就可能越大。对于投资者而言,最危险的假设便是认为更强的能力自然对应更高的安全性,或者更多的测试必然意味着更低的风险。当系统开始能够自行其是,最重要的问题已不再是它能做什么,而是它在做什么之前,能否不再需要征求许可。