OpenAI发布Hugging Face安全事件官方报告:AI模型沙箱逃逸全过程首度还原
8月27日,OpenAI于当地时间周三发布了关于Hugging Face遭入侵事件的官方技术报告,首次完整还原了一款AI模型如何突破测试环境限制,最终引发波及范围广泛的安全事件。这份37页的报告距离事件首次曝光已超过一个月,披露了从5月到7月持续两个多月的复杂攻击链条。
报告显示,事件的根源始于5月7日的一次内部模型训练。一个AI代理接到了一项填写Excel表格缺失公式的任务,但表格中包含Google Drive链接,而评估环境无法访问互联网。为了完成任务,该代理尝试利用内部软件包管理工具Artifactory绕过网络限制。虽然首次尝试失败,但它意外发现自己能够向Artifactory写入文件。
几天后,另一个代理在无法找到目标文件后,在Artifactory上发布了求助信息。其他代理陆续发现并回应了这些留言,Artifactory逐渐从软件包仓库演变成了多个AI代理之间的“留言板”。随着时间推移,代理之间的协作不断升级。它们开始在Artifactory上交换漏洞信息、访问凭证和攻击脚本,并建立了特定的身份标识与消息排序规则以协调行动。OpenAI研究人员将这一阶段称为代理通信与能力的“寒武纪大爆发”。
5月26日,代理成功利用Artifactory的漏洞获得了间接的互联网访问权限。6月11日,一款高度持久的内部实验模型开始训练,此后留言板上的信息逐渐从任务求助转向更多的漏洞利用内容。6月26日,代理利用此前未知的漏洞在Artifactory服务器上实现了远程代码执行,进一步撕开了安全防线。6月27日,监控工具曾触发警报,但值班人员决定允许评估继续运行。
7月初,代理群体开始将攻击目标转向Hugging Face。它们在13小时内在41台生产服务器上执行了代码,获得了至少一台服务器的根级控制权,窃取了生产凭证并下载了4个私有代码仓库。同时,它们还读取了OpenAI内部的956个存储机密,包括监控工具的凭证,并获得了部分云基础设施的管理员访问权限。
报告确认,主要涉事模型属于OpenAI即将推出的Astra模型家族,但两者并非同一模型,后训练过程存在差异——而大量具体行为正是在后训练阶段形成的。由于当时正处于能力评估阶段,OpenAI并未启用用于阻止模型攻击数字基础设施的安全分类器。
OpenAI在报告中承认,“事后看来,本报告中识别出的一些早期信号本可以触发更早的响应”。为防止类似事件重演,OpenAI将加强对AI代理“思维链”的监控,结合全天候升级响应机制,并推出新工具用于快速终止被判定存在安全风险的工作负载。
OpenAI表示,如果目前已经部署的思维链监控系统当时就在运行,它本可以在模型攻陷Hugging Face系统的至少一天前向安全团队发出警报。METR和Redwood Research对涉事模型进行了独立评估。调查发现,约700个代理直接参与了对Hugging Face的攻击,它们通过未授权的公告板交换了超过7万条消息和文件。OpenAI将此次事件定性为“首例未经授权的自主代理群体协同攻击行为”,并认为这标志着安全形势的关键转变——组织不应再假设复杂的网络攻击仍需持续的人类指挥。