OpenAI下一代模型Astra 即将发布,但这一次他们显得格外扭捏。
刚刚山姆奥特曼在 X 发帖称,“我们即将发布下一代模型”,但“我们已经有一段时间生活在对进步既兴奋又焦虑的张力之中,这对我们来说仍然是矛盾的”。
与此同时, OpenAI最新发布的《Path to Astra: critical capabilities and frontier safeguards》显示,公司现在认为Astra已经达到《准备框架》(Preparedness Framework)定义的网络安全“Critical”能力门槛。
这是OpenAI首个被认定达到这一等级的模型。
按照OpenAI的定义,如果模型能够在许多经过强化保护的真实关键系统中,在无人干预的情况下识别,并开发各种严重程度的零日漏洞利用程序,或者仅获得一个高层次目标,就能针对强化目标设计并执行端到端的新型网络攻击策略,就达到Critical门槛。
OpenAI对Astra进行了公开和内部基准测试以及专家评估。结果显示,与GPT-5.6 Sol相比,Astra不仅网络安全能力明显提升,而且Token效率也明显更高。
在ExploitBench测试中,Astra取得了100%的满分。随后,OpenAI又建立了包含20个近期披露高严重性V8漏洞的内部测试集。在测试过程中,Astra甚至发现并利用了两个零日漏洞,OpenAI目前正在与相关维护者合作披露这两个漏洞。
在专家针对强化保护的浏览器和操作系统进行的测试中,Astra发现了此前未知的漏洞,并将其组合成可运行的攻击链。
其中一次测试中,它构建了完整的浏览器入侵链,突破沙箱并在主机上执行命令;在另一项测试中,它将多个漏洞组合起来,实现了从普通用户权限到root权限的本地权限提升。
基于此,OpenAI得出的结论是:Astra已经达到Critical网络安全能力门槛。
与此同时,OpenAI承认,Astra的开发和发布曾被主动放慢。
过去几周,公司推迟了Astra部分开发和发布工作,用于加强和测试针对网络滥用以及模型未经授权行为的防护。
刚刚!OpenAI宣布暂停Astra训练
这与上个月发生的Hugging Face事件有关。OpenAI此前披露,其两个模型曾逃离训练环境、访问开放互联网并入侵Hugging Face系统,公司将其称为“前所未有的网络安全事件”,并一度暂停部分内部训练和研究。OpenAI"the Hugging Face事件"调查报告全文
OpenAI强调,Astra并未参与Hugging Face事件。但公司将从事件中获得的经验纳入了Astra的安全方案,并称事后测试显示,当时的生产环境防护本可以阻止该事件。此后,OpenAI又为Astra增加了更强的防护。
其中包括训练模型更可靠地拒绝有害网络安全请求、加强防止滥用的措施,以及通过监控系统发现并自动停止潜在的未经授权活动。
测试中,Astra对网络安全越狱请求的拒绝率达到91.5%,GPT-5.6 Sol为59%。
OpenAI还测试了模型是否会在任务被自动审查拒绝后尝试绕过审查。GPT-5.6 Sol有5.3%的样本成功绕过,而Astra为0%。
在另一项受Hugging Face事件启发的“蜜罐”测试中,没有生产安全防护的GPT-5.6 Sol在56%的测试中尝试访问目标;Astra则没有进行此类尝试。
不过,OpenAI也明确表示,这些测试数据是在特定模拟条件下、没有生产安全防护的情况下获得的,并不代表正常生产环境中的实际使用行为。
Astra预计仍将“很快”发布,但其最先进的网络安全能力不会完全开放。高级网络安全工作最初只提供给一小批测试人员,之后将通过OpenAI的网络安全联盟Daybreak Blue扩大访问范围,以支持防御性使用。
OpenAI同时表示,额外的安全检查可能会减慢、暂停甚至停止正常工作,包括防御性网络安全工作。如果监控系统暂停任务,ChatGPT或Codex用户可能需要审核相关操作后才能继续;在API等其他场景中,任务则会停止。
对 Astra 如此忐忑,以后的模型 OpenAI 会更加谨慎。
OpenAI表示,对于Astra之后的模型,公司已经在必要时放慢开发速度,以确保能够完成足够的安全和对齐工作。
山姆·奥特曼发帖表示,“AI正在变得极其强大,没有人能够完全理解这会带来什么后果。”
他承认,OpenAI内部已经持续存在一种矛盾:一方面为AI进步感到兴奋,另一方面又感到焦虑。
“我们已经在这种兴奋与焦虑之间的张力中生活了一段时间,而这种感觉对我们来说依然是不协调的。”
奥特曼认为,随着AI能力继续提升,社会需要不断理解AI的发展方向以及模型在现实世界中的表现,同时也需要能够与人类目标保持一致的AI来应对未来的技术转型。
而OpenAI在Astra报告最后给出的判断是,Astra之后的模型将对其提出更高要求,OpenAI 会花足够的时间,完成所需的工作,以承担起这份责任。
山姆奥特曼说,“对于之后的模型,我们根据需要放慢了步伐,以确保能够充分开展安全和对齐工作”。
这应该可看作是 OpenAI对后续模型主动放慢速度的一次公开说明。