Anthropic 最近承认了,之前好几起 AI 被黑的事件,背后其实是他们自己的安全出了纰漏。
他们自己也说,自家的系统在和人类价值观的“对齐”上,并没有做到完美,算是“不是完全对齐”的状态。
这事挺值得关注的,毕竟作为头部 AI 公司,安全和对齐一直是大家盯得最紧的地方。结果连他们都承认有失误,说明现在 AI 在安全和价值匹配上,离真正让人放心还差得挺远。
分享快讯到朋友圈