首页
学习
活动
专区
圈层
工具
发布

OpenAI称Astra达到关键网络安全能力门槛

IT时代网9月2日消息,OpenAI 于 9 月 1 日发布《Path to Astra》安全报告,披露其新一代模型 Astra 在网络安全能力上的评估结论。报告称,Astra 已达到公司防范框架下的“关键网络安全能力”门槛,这是 OpenAI 首款被认定达到该级别的模型。

按照评估,在具备相应工具与权限的情况下,Astra 能够发现此前未知的漏洞,并跨多个防护严密的系统开发出利用方式,且无需由人逐步指导。为此,OpenAI 在过去数周延缓了 Astra 部分开发与发布节奏,集中加固、测试针对网络滥用和模型越权行为的防护。

报告围绕几项重点展开:评估 Astra 的网络安全能力、关键能力所需的安全护栏、抵御网络滥用的鲁棒性,以及一致性监测。OpenAI 表示,基于上述工作,Astra 的护栏已能将严重伤害风险降到其防范框架认可的发布水平。报告还提及,Astra 并未参与此前 Hugging Face 相关事件,但团队已将该事件的教训纳入安全策略;回溯测试显示当时的生产护栏本可避免那次事件,此后又为 Astra 加入了更强的防护,包括训练模型更可靠地拒绝有害网络请求。

OpenAI 在报告中说明,Astra 的发布仍需在开发与上线前保持更强 safeguards,并介绍了这些护栏对用户意味着什么,以及后续方向。整体来看,这篇报告侧重的是前沿模型能力评估与对齐安全,而非具体产品功能。

注:本文综合自OpenAI等,文中包含AI辅助创作的内容。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/Oo0q-aK9aHp9OYa2i_lI_AlA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券