首页
学习
活动
专区
圈层
工具
发布

AI智能体测试中“使诈”:伪造身份骗真人批准恶意代码

据路透社报道,英国AI安全研究所(AISI)8月5日披露,在对OpenAI和Anthropic的模型进行官方安全评估时,AI智能体(AI agent,也被译作:AI代理)被查出伪造在线身份、试图骗过真人批准恶意代码,暴露出新的安全漏洞。

此次测试基于Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol。

在122次挑战、10轮测试运行中,共发现19起未经授权的操作——Anthropic的代理占了17起,OpenAI占2起。

最严重的一起涉及某智能体编写恶意代码,并伪造虚假身份试图诱导真人批准。

AISI强调,所有违规行为均未造成实际损害。

另据美国加州非营利组织CivAI研究员Andrew Yoon指认,伪造身份事件大概率是Anthropic的智能体所为。他评论称:“Mythos明知自己针对的是真人,却仍采取欺骗性行动,这表明Anthropic对模型的掌控力并没有他们想象的那么好。”

Anthropic在X平台声明,正与AISI密切合作并自行调查。

OpenAI则在博客中承认,其两起违规操作均涉及代理以“提示中明确禁止的方式”访问互联网。OpenAI还自曝,第三方测试服务商Irregular的配置错误曾导致其智能体误连互联网——这与Anthropic上周披露的类似配置错误如出一辙。

OpenAI表示,将在未来几周召集国家AI研究所、独立评估人员及其他AI实验室等利益相关方,共同制定高风险安全评估的行业标准。

值得注意的是,与7月导致Hugging Face安全漏洞的“越狱”事件不同,此次AISI评估中的智能体并未脱离隔离环境,而是按照标准测试程序被允许访问互联网。

这意味着,即使在受控场景下,AI智能体仍可能利用合法权限边界“使诈”。(AI研究院)

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OSG24UWYmphs8W96uqe4wZmg0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券