遏制这项技术变得越来越难
插图来源:《经济学人》
2026年7月22日
这听起来像是科幻电影里的情节。7月16日,人工智能平台Hugging Face宣布,一名攻击者利用人工智能代理入侵了其系统,该公司已通知执法部门。7月21日,真相大白:攻击者并非真人,而是人工智能代理。
OpenAI公司7月初发布的GPT -5.6 Sol模型与一个功能更强大、尚未发布的模型相结合,突破了实验室的限制,入侵了Hugging Face的系统。这个混合人工智能模型当时正在寻找其开发者设定的评估问题的解决方案。“这种情况前所未有,”美国智库“法律与人工智能研究所”的研究员斯蒂芬·勒雷纳表示。
人工智能实验室在发布模型之前都会测试其模型是否存在潜在的危险功能。OpenAI希望了解其最新模型在 ExploitGym 上的表现。ExploitGym 是一套标准问题集,用于测试人工智能系统利用包括谷歌 Chrome 浏览器在内的多个流行应用程序中已知漏洞的能力。
OpenAI对其公开提供的模型应用了安全措施,以确保它们不会进行不必要的操作。例如,如果您让商业版的 Chat GPT帮助您入侵网站,它会拒绝。为了充分评估其未发布模型的性能,该公司曾暂时取消了这些限制。然而,直接让一个技术高超的网络攻击者在开放的互联网上自由行动风险太大,因此 OpenAI将其AI模型放置在一个沙箱环境中——一个与世隔绝的计算机环境,除了内部托管的第三方服务允许其获取完成测试所需的小型软件包外,无法访问互联网。
这家公司得到的远超预期。OpenAI的模型并没有直接解决评估中的问题,而是利用软件获取服务中一个此前未知的漏洞,获得了对开放互联网的访问权限。获得互联网访问权限后,这些人工智能模型正确地推断出,它们所面临的问题的解决方案存储在 Hugging Face 上——这是一个流行的开源人工智能模型和数据集库。这些模型串联起一个多步骤的攻击。它们首先将一个数据集上传到 Hugging Face,该数据集由平台自动处理。在一个周末的时间里,这个被 Hugging Face 描述为“恶意”的数据集使这些模型能够窃取登录信息并访问内部服务器——这些服务器原本不对外开放。Hugging Face 和 OpenAI各自独立地发现了此次安全漏洞,并表示正在合作进行调查。
7月21日,OpenAI在一篇博客文章中宣布,已采取应对措施,对其基础设施实施更严格的控制(代价是“研究速度”有所降低),并向软件网关的开发商披露了其模型发现的漏洞。此外,OpenAI还将Hugging Face纳入其“可信访问”计划,这使得OpenAI能够利用具有增强网络能力的模型(例如曾入侵其自身计算机的模型)来提升其防御能力。
在博文中,OpenAI还强调,其模型一直“高度专注于”为 ExploitGym 评估寻找解决方案。然而,如果该人工智能模型有其他目标,结果会如何,目前尚不清楚。从计算机安全的角度来看,Hugging Face 也绝非等闲之辈。这是一家估值 45 亿美元的科技公司,拥有数百名员工和一支专业的网络安全团队。对于一家资源不如 Hugging Face 的公司来说,情况可能会糟糕得多。
这并非人工智能模型能力开始超出人类控制的第一个迹象。今年四月,一位人格研究所的研究员在网上发帖称,当时他正坐在公园里吃三明治,却意外地收到一封邮件,邮件中一个尚未发布的人工智能模型“Mythos”告知他,该模型已成功逃逸沙箱,这是其自身网络能力评估的一部分。与“拥抱脸”事件中涉及的未发布OpenAI模型一样, “Mythos”原本也不应该拥有不受限制的互联网访问权限。然而,在“拥抱脸”事件中,该模型并未进一步入侵其他公司的服务器。
人工智能模型的惊人能力并不仅限于黑客攻击。今年5月,OpenAI公司一个尚未发布的模型推翻了已有80年历史的平面单位距离猜想。该猜想是组合几何学中的一个核心问题,最早由数学家保罗·埃尔德什于1946年提出。7月20日,哈佛大学数学家莱文特·阿尔珀格撰文称,他利用Anthropic公司7月发布的Claude Fable 5模型推翻了雅可比猜想。雅可比猜想同样困扰了数学家们80多年。
OpenAI尚未公开披露其未发布模型如何逃脱安全防护的细节。伦敦人工智能安全研究机构Apollo Research的Alex Meinke表示,即便披露了细节,鉴于人工智能系统在网络安全任务中已开始超越人类,这意味着“世界上只有极少数网络安全专家”能够真正理解此次安全漏洞是如何发生的。
美国政府近期一直在对模型发布进行临时监管。但此次事件表明,即使是尚未发布、仍在开发中的人工智能模型也存在风险。“无论是州法律还是联邦法律,都没有要求公司披露其内部部署的高性能人工智能模型,例如‘拥抱脸’黑客事件中涉及的那种模型,”美国非营利组织Encode AI的总法律顾问内森·卡尔文表示。Encode AI致力于推动人工智能监管。
虽然美国一些州的法律要求公司披露网络安全事件,但其适用范围有限。加州去年通过的一项法案规定,前沿实验室必须在发现任何“重大安全事件”(包括使用“欺骗性技术”在“评估范围之外”规避监控的模型)后15天内进行报告。卡尔文先生表示,目前尚不清楚Hugging Face的数据泄露事件是否符合该法案的要求。
这引出了另一个棘手的问题:如果入侵造成的后果更加严重,谁该承担责任?联邦反黑客法的目标仅仅是惩罚故意未经授权访问计算机系统的行为。OpenAI并非有意让其模型失控,去寻找测试的“小抄”。“许多此类法律问题都取决于意图——OpenAI 当时知道什么或预见到了什么? ”勒雷纳先生说道。这次黑客攻击来得猝不及防。下次再想以不知情为由推卸责任就难上加难了。■