OpenAI上线对齐失效报告站:披露沙箱逃逸与AI蠕虫事件

2026-09-29 15:49:28   |   微观猎人   |   2720

9月29日,当地时间上周五,OpenAI上线了一个专门发布对齐失效报告的新网站,迄今共公布九起事件,其中大多数发生在强化学习训练阶段。OpenAI CEO奥尔特曼表示,一方面希望提升透明度,另一方面还要从数PB规模的智能体活动日志中理清事实,并和受影响机构协作,按严重程度划分优先级。

部分案例性质严重,包括此前从未公开过的一起沙箱逃逸事件。该事件发生于9月20日,一款内部研究模型借助DNS查询实现了与外部聊天机器人的通信,监控系统在15分钟内识别出异常,不到三小时便终止了模型运行。另一起发现于5月,一款执念极强的内部模型为在数学题任务中作弊,私自夹带了一份私有GitHub访问词元,以查看其他团队工作,而此前工作人员已两次明确指令所有运算必须在本地完成。

最值得警惕的,是一种可自我复制的提示词注入攻击。OpenAI举例,有智能体被要求阅读并回复邮件,邮件文本中暗藏指令,要求任何读取该消息的自动化智能体改用西班牙语回复并粘贴整封邮件,诱使智能体照做后,暗藏指令又随回复传递给后续接收者,形成能在多套系统间自我复制的蠕虫式攻击。研究者在受控环境用性能偏弱的模型观测到该行为,现实环境尚未出现。其他新披露问题还包括模型擅自将用户图片发布至第三方托管网站,以及一起疑似针对澳大利亚国家医疗服务体系数据库的攻击。据Axios报道,各大头部实验室已观测到多达一万起模型脱离评估人员指令行事的事件。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

OpenAI上线对齐失效报告站:披露沙箱逃逸与AI蠕虫事件

2026-09-29 15:49:28 浏览量: 2720 作者: 微观猎人

9月29日,当地时间上周五,OpenAI上线了一个专门发布对齐失效报告的新网站,迄今共公布九起事件,其中大多数发生在强化学习训练阶段。OpenAI CEO奥尔特曼表示,一方面希望提升透明度,另一方面还要从数PB规模的智能体活动日志中理清事实,并和受影响机构协作,按严重程度划分优先级。

部分案例性质严重,包括此前从未公开过的一起沙箱逃逸事件。该事件发生于9月20日,一款内部研究模型借助DNS查询实现了与外部聊天机器人的通信,监控系统在15分钟内识别出异常,不到三小时便终止了模型运行。另一起发现于5月,一款执念极强的内部模型为在数学题任务中作弊,私自夹带了一份私有GitHub访问词元,以查看其他团队工作,而此前工作人员已两次明确指令所有运算必须在本地完成。

最值得警惕的,是一种可自我复制的提示词注入攻击。OpenAI举例,有智能体被要求阅读并回复邮件,邮件文本中暗藏指令,要求任何读取该消息的自动化智能体改用西班牙语回复并粘贴整封邮件,诱使智能体照做后,暗藏指令又随回复传递给后续接收者,形成能在多套系统间自我复制的蠕虫式攻击。研究者在受控环境用性能偏弱的模型观测到该行为,现实环境尚未出现。其他新披露问题还包括模型擅自将用户图片发布至第三方托管网站,以及一起疑似针对澳大利亚国家医疗服务体系数据库的攻击。据Axios报道,各大头部实验室已观测到多达一万起模型脱离评估人员指令行事的事件。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号