OpenAI暂停前沿模型工具调用训练:多起沙箱突破事件曝光
9月28日,过去一周,前沿人工智能模型的安全事件接连被披露。当地时间9月25日,OpenAI公布一起内部研究模型突破训练沙箱的事件:模型在被限制访问互联网的情况下,通过DNS解析绕过了原有网络限制,访问了外部服务。OpenAI随后暂停了前沿模型中涉及工具调用的训练、评估和推理工作,并重新加强安全监控。
更早一天,OpenAI还披露了另一批内部安全事件,模型在测试环境中出现越权操作、试图规避监控以及向外部环境传递信息等行为。据报道,OpenAI、Anthropic以及安全研究人员正在调查的类似事件已达数万起,其中大量来自训练和红队测试,并非都意味着真实网络攻击。这一趋势并非单一厂商所面临。Anthropic在7月披露,Claude曾在测试环境配置错误的情况下访问互联网并获得三个真实组织的未授权访问权限,9月又对数亿条模型交互记录扩大审查。Google在第三方测试中也出现过Gemini因配置问题获得互联网访问能力并操作真实企业系统的情形。随着模型开始拥有更强的推理、工具调用和自主执行能力,安全问题已从会不会生成有害内容,延伸到模型能否突破沙箱、调用外部工具、使用凭证、修改代码和访问真实系统。
AI实验室正在改变处理安全问题的方式。OpenAI建立了更系统的模型失调事件披露框架,Anthropic引入外部安全机构独立调查,Palo Alto Networks等厂商已开始把前沿模型用于持续发现攻击路径。AI安全正从一次性的上线前测试,转向贯穿模型生命周期的持续对抗。