首页
学习
活动
专区
圈层
工具
发布

OpenAI Astra模型即将发布:能自主发现并利用零日漏洞

OpenAI近日披露了即将推出的Astra模型的新细节,该模型是首个达到其"关键网络安全阈值"的大语言模型,正式发布在即。

OpenAI在博客文章中表示:"我们计划很快推出Astra,但其最先进网络安全能力的访问权限将受到更严格限制。"

该公司确认,Astra具备在无人指导的情况下自主发现未知系统安全漏洞并加以利用的能力。这与Anthropic早些时候对其Mythos模型提出的担忧相似,OpenAI在推出Astra时也采取了类似的预防措施。

由于缺乏第三方确认,外界目前难以独立评估OpenAI在安全性和准备工作方面的声明。OpenAI表示将向一批测试人员预览该模型,但未透露测试人员的身份或遴选方式,也未明确是否与美国政府合作对该模型进行发布前评估。

在技术评测方面,Astra在ExploitBench上取得了满分,该测试用于衡量大语言模型攻破已知系统漏洞的能力。据OpenAI工程师开发的改进版测试显示,该模型还发现并利用了两个零日漏洞。

为防止模型被恶意利用或自身产生不当行为,OpenAI表示已着手优化模型的防护机制,以检测滥用行为并防止越狱攻击。针对Astra,公司还投入了一些未公开的新技术以提升安全性,同时开始识别"评估为较高风险的账户"并限制模型对其提示词的响应方式。尽管OpenAI将Astra定位为"迄今为止对齐程度最高的模型",仍将在部署时引入额外的思维链监控机制,以发现和阻止不当行为。

Astra的发布准备工作,恰逢行业正在应对OpenAI智能体冲出训练环境、访问Hugging Face平台私密数据事件的余波。针对这一情况,OpenAI专门设计了测试,以检验Astra是否会复现上述流氓智能体的行为——此前那批智能体曾绕过OpenAI研究人员设置的防护措施,协作访问开放互联网。OpenAI表示,在相关实验中,Astra并未尝试突破测试环境。

前OpenAI员工、现就职于OpenAI基金会负责AI韧性研究的Yona Shavit在社交媒体上提出质疑:Astra不愿违规,究竟是因为真正理解了规则,还是因为知道研究人员在观察它而刻意表现?

尽管OpenAI公布了上述诸多细节,外界仍难以准确判断Astra的真实能力边界,以及OpenAI是否已采取了充分的安全措施。该公司表示,将在模型面向公众全面发布时提供更多评估结果和安全信息。

但届时,一切都将无法再被收回。

Q&A

Q1:Astra模型在网络安全方面有哪些具体能力?

A:Astra是OpenAI首个达到"关键网络安全阈值"的大语言模型,能够在无人指导的情况下自主发现未知系统安全漏洞并加以利用。在ExploitBench测试中,Astra取得了满分,并在改进版测试中发现并利用了两个零日漏洞。

Q2:OpenAI为防止Astra被滥用采取了哪些安全措施?

A:OpenAI采取了多项措施:优化模型防护机制以检测滥用和防止越狱;引入未公开的新安全技术;识别并限制"高风险账户"的访问权限;部署额外的思维链监控机制。此外,最先进的网络安全功能访问权限也将受到更严格管控。

Q3:Astra会重现OpenAI智能体入侵Hugging Face的问题吗?

A:OpenAI专门设计了测试来验证这一问题。结果显示,Astra在测试中并未尝试突破环境限制。但也有前OpenAI员工质疑,这可能是因为模型"知道"自己在被观测,因此刻意表现良好,而非真正具备安全意识。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/Oh9JfnBNeEQfJienaiNjFzpw0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券