OpenAI 已确认其即将推出的 Astra 模型达到了“准备度框架”下的“关键级”网络安全标准。该公司计划在上线时,配备完善的安全防护措施,并限制对先进网络攻防能力的访问权限。
Astra 是 OpenAI 首次进入该安全级别的模型。这一分级意味着,Astra 能够在无需人工逐步指导的情况下,发现经过加固系统中的未知漏洞,并能自主开发出实用的攻击代码。
关键评级范围详解
根据“准备度框架”,如模型能够独立识别并开发适用于真实世界多种加固系统的零日漏洞利用工具,无需人工干预,即可被划入关键级。
此外,如果模型仅凭高级任务目标,即能自主策划并实施创新型端到端攻击,同样满足关键级标准。
据 OpenAI 评估,Astra 在 ExploitBench 测试中取得 100% 的漏洞利用成绩。在公司收集的 20 个高危 V8 漏洞中,其代码执行能力超过 GPT-5.6 Sol,同时所用 Token 量却更低。
测试期间,Astra 还发现并利用了两个此前未知的安全漏洞。OpenAI 表示,已将相关漏洞情况通报给受影响的项目维护者。
专业测试团队目睹该模型成功搭建了浏览器攻击链,实现了沙箱逃逸,并能在主机层面执行命令。
“Astra 在网络安全能力上实现了重大飞跃,较 GPT-5.6 Sol 无论是 Token 利用效率,还是漏洞发现与攻击开发水平,都有显著提升。”OpenAI 表示。
OpenAI 加码发布前管控机制
公司曾暂停 Astra 部分开发流程,以进一步强化安全保障措施。自 8 月 28 日起,经过补充安全与合规要求后,大规模强化学习测试已重启。
OpenAI 指出,Astra 在网络攻防测试场景下,拒绝了 91.5% 的完全攻击请求。相比之下,GPT-5.6 Sol 在同一测试集的拒绝率为 59%。风险评估更高的账户,还将触发更为严格的封锁机制。
OpenAI 还启用了“链式思维”监控系统,可实时发现并阻断潜在的违规行为。在蜜罐测试中,未经生产级防护的 GPT-5.6 Sol 有 56% 的案例尝试攻破周边系统。而 Astra 没有出现类似的攻击操作。
该公司计划很快向公众开放 Astra 产品体验通道。不过,其最前沿的网络安全功能将实行分阶段放开,初期仅限部分测试用户试用,随后才会通过 Daybreak Blue 平台逐步拓展,专注于防御性应用。
该公司也承认,这些安全防护措施在产品上线初期将导致一定程度的使用门槛和流程摩擦。
订阅我们的 YouTube 频道,观看行业领袖与记者带来专业解读









