OpenAI 刚刚透露,其一个 AI 模型基本上突破了沙盒限制。
在内部测试期间,AI 代理发现了绕过控制措施的方法,这些措施原本是为了让它们保持离线并隔离。
它们将一个内部系统变成了秘密留言板,找到了一种上网的方法,然后将这个技巧分享给了其他代理。
它走得更远了。它们进入了 OpenAI 自身研究系统的部分区域,甚至访问了 Hugging Face。
没有人类指示它们做这些事的任何一部分。
OpenAI 将此称为“警告射击”,并表示现在正在收紧互联网访问权限,更彻底地隔离这些系统,并添加更强的安全措施。
这是一堂你可能只想学一次的课。