OpenAI宣布新安全政策:加强模型开发监控与网络隔离,强化训练阶段管控
8月19日,OpenAI宣布了一系列新的安全政策,重点加强对模型开发过程中安全事件的管控,提升了对模型训练和测试阶段的监控与隔离力度。这是自7月21日披露Hugging Face安全事件以来,OpenAI首次在安全实践方面公布的重大调整。
新的安全措施包括在模型开发过程中引入更细致的监控系统,该系统将检查工具执行的操作、推理轨迹及活动日志,目标是在发现可疑活动后30分钟内发出警报。OpenAI估计,该监控系统所需的计算资源约占被监控流程本身的20%。同时,OpenAI进一步强化了网络隔离,确保“单个工作负载或支持服务遭入侵不会导致攻击者未经授权访问互联网或其他内部网络”。
在训练管控方面,OpenAI在Hugging Face事件发生后曾暂停强化学习(RL)训练两周,目前已重启多数风险较低模型的训练,但规模最大的前沿强化学习训练计划仍处于暂停状态,仅开展小规模训练和评估以验证安全措施。OpenAI表示,随着模型能力不断增强,安全控制标准的严格程度也将随之提高,能力最强的模型将接受最严格的审查。
OpenAI代表表示,这些措施并非直接针对Hugging Face事件推出,但即将发布的Astra模型展现出的网络安全能力,以及整个AI行业快速发展的步伐,是促使公司采取这些措施的部分原因。目前,OpenAI尚未发布针对Hugging Face事件的官方事后分析报告。