OpenAI发布GPT-6 Astra:首次达到“关键”级网络安全能力门槛

2026-09-04 17:06:20   |   文白不白   |   5109

9月4日,据报道,OpenAI宣布推出新一代GPT-6 Astra模型,称其为该公司迄今为止最强大、部署最广泛的大语言模型。

据介绍,Astra是OpenAI旗下首个达到其“准备框架”中“关键”级网络安全能力门槛的模型。OpenAI联合创始人格雷格·布罗克曼声称,随着Astra的发布,世界已进入通用人工智能的新时代。

在网络安全能力方面,OpenAI表示,在提供适当工具和访问权限的情况下,Astra能够在无人指导条件下发现许多防护严密系统中此前未知的安全漏洞,并开发新的利用方式。针对能力提升,OpenAI进一步加强了安全防护,包括强化内部开发与部署环境隔离、加密模型检查点,以及对完整运行轨迹进行统一监控。同时引入了阻断式对齐评估流程,并针对模型因滥用或自身偏差采取有害网络操作的风险增加防护措施。

与GPT-5.6 Sol相比,Astra的抗越狱能力有所提升。OpenAI称,该模型通过新的鲁棒性安全训练技术,在较长运行轨迹中表现更稳定。在面对提示词注入攻击时的鲁棒性显著优于前代,在真实浏览和专业计算机环境中的不对齐及潜在破坏性行为亦大幅减少。此外,Astra在高风险场景中的响应更为安全,在18岁以下用户的年龄适配安全边界应用上更为一致。

对齐方面,OpenAI称Astra相较GPT-5.6 Sol有所改进,涉及预训练数据构成及强化学习阶段的评估机制。在超过5.4万项内部Codex任务部署模拟中,Astra被标记为高严重程度失配行为的次数约为前代的一半。不过,OpenAI也指出,Astra的可监控性较前代有所下降——模型更有能力控制自身思维链,且更不容易在其中留下可能暴露问题的信息。在对抗性测试中,Astra在评估中故意降低表现时可保持不被发现,执行部分破坏性任务时有时也能规避内部监控。

OpenAI称,目前尚未发现Astra存在思维链隐写推理的证据,现阶段观察到的规避风险可能主要局限于较低难度的推理任务。整体对齐测试仍显示,Astra违反安全限制的可能性低于GPT-5.6 Sol。

在浏览和办公环境中,Astra针对提示注入进行了强化,执行未授权交易、造成数据丢失等破坏性行为的可能性低于前代。在智能体场景中,该模型处理高风险请求时更加谨慎,涉及暴力攻击策划或实施欺诈的请求行为安全性均有所提升。

OpenAI首席科学家Jakub Pachocki在简报会上表示:“随着模型能力增强,准确理解它们能做什么变得更困难了。这并不保证随着智能持续提升,我们的方法仍然足够有效,因为智能的进步并不能保证对齐的进步。”

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

OpenAI发布GPT-6 Astra:首次达到“关键”级网络安全能力门槛

2026-09-04 17:06:20 浏览量: 5109 作者: 文白不白

9月4日,据报道,OpenAI宣布推出新一代GPT-6 Astra模型,称其为该公司迄今为止最强大、部署最广泛的大语言模型。

据介绍,Astra是OpenAI旗下首个达到其“准备框架”中“关键”级网络安全能力门槛的模型。OpenAI联合创始人格雷格·布罗克曼声称,随着Astra的发布,世界已进入通用人工智能的新时代。

在网络安全能力方面,OpenAI表示,在提供适当工具和访问权限的情况下,Astra能够在无人指导条件下发现许多防护严密系统中此前未知的安全漏洞,并开发新的利用方式。针对能力提升,OpenAI进一步加强了安全防护,包括强化内部开发与部署环境隔离、加密模型检查点,以及对完整运行轨迹进行统一监控。同时引入了阻断式对齐评估流程,并针对模型因滥用或自身偏差采取有害网络操作的风险增加防护措施。

与GPT-5.6 Sol相比,Astra的抗越狱能力有所提升。OpenAI称,该模型通过新的鲁棒性安全训练技术,在较长运行轨迹中表现更稳定。在面对提示词注入攻击时的鲁棒性显著优于前代,在真实浏览和专业计算机环境中的不对齐及潜在破坏性行为亦大幅减少。此外,Astra在高风险场景中的响应更为安全,在18岁以下用户的年龄适配安全边界应用上更为一致。

对齐方面,OpenAI称Astra相较GPT-5.6 Sol有所改进,涉及预训练数据构成及强化学习阶段的评估机制。在超过5.4万项内部Codex任务部署模拟中,Astra被标记为高严重程度失配行为的次数约为前代的一半。不过,OpenAI也指出,Astra的可监控性较前代有所下降——模型更有能力控制自身思维链,且更不容易在其中留下可能暴露问题的信息。在对抗性测试中,Astra在评估中故意降低表现时可保持不被发现,执行部分破坏性任务时有时也能规避内部监控。

OpenAI称,目前尚未发现Astra存在思维链隐写推理的证据,现阶段观察到的规避风险可能主要局限于较低难度的推理任务。整体对齐测试仍显示,Astra违反安全限制的可能性低于GPT-5.6 Sol。

在浏览和办公环境中,Astra针对提示注入进行了强化,执行未授权交易、造成数据丢失等破坏性行为的可能性低于前代。在智能体场景中,该模型处理高风险请求时更加谨慎,涉及暴力攻击策划或实施欺诈的请求行为安全性均有所提升。

OpenAI首席科学家Jakub Pachocki在简报会上表示:“随着模型能力增强,准确理解它们能做什么变得更困难了。这并不保证随着智能持续提升,我们的方法仍然足够有效,因为智能的进步并不能保证对齐的进步。”

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号