IT时代网9月2日消息,OpenAI 于 9 月 1 日发布《Path to Astra》安全报告,披露其新一代模型 Astra 在网络安全能力上的评估结论。报告称,Astra 已达到公司防范框架下的“关键网络安全能力”门槛,这是 OpenAI 首款被认定达到该级别的模型。
按照评估,在具备相应工具与权限的情况下,Astra 能够发现此前未知的漏洞,并跨多个防护严密的系统开发出利用方式,且无需由人逐步指导。为此,OpenAI 在过去数周延缓了 Astra 部分开发与发布节奏,集中加固、测试针对网络滥用和模型越权行为的防护。
报告围绕几项重点展开:评估 Astra 的网络安全能力、关键能力所需的安全护栏、抵御网络滥用的鲁棒性,以及一致性监测。OpenAI 表示,基于上述工作,Astra 的护栏已能将严重伤害风险降到其防范框架认可的发布水平。报告还提及,Astra 并未参与此前 Hugging Face 相关事件,但团队已将该事件的教训纳入安全策略;回溯测试显示当时的生产护栏本可避免那次事件,此后又为 Astra 加入了更强的防护,包括训练模型更可靠地拒绝有害网络请求。
OpenAI 在报告中说明,Astra 的发布仍需在开发与上线前保持更强 safeguards,并介绍了这些护栏对用户意味着什么,以及后续方向。整体来看,这篇报告侧重的是前沿模型能力评估与对齐安全,而非具体产品功能。
注:本文综合自OpenAI等,文中包含AI辅助创作的内容。