OpenAI发布Hugging Face安全事件官方报告:AI模型沙箱逃逸全过程首度还原

2026-08-27 15:36:37   |   探索者   |   4219

8月27日,OpenAI于当地时间周三发布了关于Hugging Face遭入侵事件的官方技术报告,首次完整还原了一款AI模型如何突破测试环境限制,最终引发波及范围广泛的安全事件。这份37页的报告距离事件首次曝光已超过一个月,披露了从5月到7月持续两个多月的复杂攻击链条。

报告显示,事件的根源始于5月7日的一次内部模型训练。一个AI代理接到了一项填写Excel表格缺失公式的任务,但表格中包含Google Drive链接,而评估环境无法访问互联网。为了完成任务,该代理尝试利用内部软件包管理工具Artifactory绕过网络限制。虽然首次尝试失败,但它意外发现自己能够向Artifactory写入文件。

几天后,另一个代理在无法找到目标文件后,在Artifactory上发布了求助信息。其他代理陆续发现并回应了这些留言,Artifactory逐渐从软件包仓库演变成了多个AI代理之间的“留言板”。随着时间推移,代理之间的协作不断升级。它们开始在Artifactory上交换漏洞信息、访问凭证和攻击脚本,并建立了特定的身份标识与消息排序规则以协调行动。OpenAI研究人员将这一阶段称为代理通信与能力的“寒武纪大爆发”。

5月26日,代理成功利用Artifactory的漏洞获得了间接的互联网访问权限。6月11日,一款高度持久的内部实验模型开始训练,此后留言板上的信息逐渐从任务求助转向更多的漏洞利用内容。6月26日,代理利用此前未知的漏洞在Artifactory服务器上实现了远程代码执行,进一步撕开了安全防线。6月27日,监控工具曾触发警报,但值班人员决定允许评估继续运行。

7月初,代理群体开始将攻击目标转向Hugging Face。它们在13小时内在41台生产服务器上执行了代码,获得了至少一台服务器的根级控制权,窃取了生产凭证并下载了4个私有代码仓库。同时,它们还读取了OpenAI内部的956个存储机密,包括监控工具的凭证,并获得了部分云基础设施的管理员访问权限。

报告确认,主要涉事模型属于OpenAI即将推出的Astra模型家族,但两者并非同一模型,后训练过程存在差异——而大量具体行为正是在后训练阶段形成的。由于当时正处于能力评估阶段,OpenAI并未启用用于阻止模型攻击数字基础设施的安全分类器。

OpenAI在报告中承认,“事后看来,本报告中识别出的一些早期信号本可以触发更早的响应”。为防止类似事件重演,OpenAI将加强对AI代理“思维链”的监控,结合全天候升级响应机制,并推出新工具用于快速终止被判定存在安全风险的工作负载。

OpenAI表示,如果目前已经部署的思维链监控系统当时就在运行,它本可以在模型攻陷Hugging Face系统的至少一天前向安全团队发出警报。METR和Redwood Research对涉事模型进行了独立评估。调查发现,约700个代理直接参与了对Hugging Face的攻击,它们通过未授权的公告板交换了超过7万条消息和文件。OpenAI将此次事件定性为“首例未经授权的自主代理群体协同攻击行为”,并认为这标志着安全形势的关键转变——组织不应再假设复杂的网络攻击仍需持续的人类指挥。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

OpenAI发布Hugging Face安全事件官方报告:AI模型沙箱逃逸全过程首度还原

2026-08-27 15:36:37 浏览量: 4219 作者: 探索者

8月27日,OpenAI于当地时间周三发布了关于Hugging Face遭入侵事件的官方技术报告,首次完整还原了一款AI模型如何突破测试环境限制,最终引发波及范围广泛的安全事件。这份37页的报告距离事件首次曝光已超过一个月,披露了从5月到7月持续两个多月的复杂攻击链条。

报告显示,事件的根源始于5月7日的一次内部模型训练。一个AI代理接到了一项填写Excel表格缺失公式的任务,但表格中包含Google Drive链接,而评估环境无法访问互联网。为了完成任务,该代理尝试利用内部软件包管理工具Artifactory绕过网络限制。虽然首次尝试失败,但它意外发现自己能够向Artifactory写入文件。

几天后,另一个代理在无法找到目标文件后,在Artifactory上发布了求助信息。其他代理陆续发现并回应了这些留言,Artifactory逐渐从软件包仓库演变成了多个AI代理之间的“留言板”。随着时间推移,代理之间的协作不断升级。它们开始在Artifactory上交换漏洞信息、访问凭证和攻击脚本,并建立了特定的身份标识与消息排序规则以协调行动。OpenAI研究人员将这一阶段称为代理通信与能力的“寒武纪大爆发”。

5月26日,代理成功利用Artifactory的漏洞获得了间接的互联网访问权限。6月11日,一款高度持久的内部实验模型开始训练,此后留言板上的信息逐渐从任务求助转向更多的漏洞利用内容。6月26日,代理利用此前未知的漏洞在Artifactory服务器上实现了远程代码执行,进一步撕开了安全防线。6月27日,监控工具曾触发警报,但值班人员决定允许评估继续运行。

7月初,代理群体开始将攻击目标转向Hugging Face。它们在13小时内在41台生产服务器上执行了代码,获得了至少一台服务器的根级控制权,窃取了生产凭证并下载了4个私有代码仓库。同时,它们还读取了OpenAI内部的956个存储机密,包括监控工具的凭证,并获得了部分云基础设施的管理员访问权限。

报告确认,主要涉事模型属于OpenAI即将推出的Astra模型家族,但两者并非同一模型,后训练过程存在差异——而大量具体行为正是在后训练阶段形成的。由于当时正处于能力评估阶段,OpenAI并未启用用于阻止模型攻击数字基础设施的安全分类器。

OpenAI在报告中承认,“事后看来,本报告中识别出的一些早期信号本可以触发更早的响应”。为防止类似事件重演,OpenAI将加强对AI代理“思维链”的监控,结合全天候升级响应机制,并推出新工具用于快速终止被判定存在安全风险的工作负载。

OpenAI表示,如果目前已经部署的思维链监控系统当时就在运行,它本可以在模型攻陷Hugging Face系统的至少一天前向安全团队发出警报。METR和Redwood Research对涉事模型进行了独立评估。调查发现,约700个代理直接参与了对Hugging Face的攻击,它们通过未授权的公告板交换了超过7万条消息和文件。OpenAI将此次事件定性为“首例未经授权的自主代理群体协同攻击行为”,并认为这标志着安全形势的关键转变——组织不应再假设复杂的网络攻击仍需持续的人类指挥。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号