首页
学习
活动
专区
圈层
工具
发布

《AI 对齐技术科普:为什么 AI 不会随意输出违规、极端内容》

《AI 对齐技术科普:为什么 AI 不会随意输出违规、极端内容》

不少人好奇,向 AI 输入偏激、暴力、侵权类指令时,模型会直接拒绝作答,这套防护机制来源于 AI 对齐技术,是大模型上线前必不可少的安全优化流程。

AI 对齐分为监督微调、人类反馈强化学习两大步骤,研发人员会收集海量合规、正向的问答样本,先通过监督学习教会模型符合社会规范的输出方式;再引入真人反馈,对模型回答打分评级,持续迭代修正不当表述,过滤暴力、造谣、低俗、违法相关内容。

对齐技术会平衡自由创作与内容安全,不会一刀切限制正常创意表达,仅拦截触碰法律法规、公序良俗的需求。但对齐存在天然短板,巧妙拆分、绕弯式诱导提问,偶尔会绕过基础防护,也就是业内常说的越狱提示词,正规平台会持续迭代封堵漏洞。

对齐不是永久固定的,平台会根据新规、网络舆情持续更新对齐数据集,不断完善安全边界。我们日常使用 AI 应当遵守内容规范,不要刻意尝试绕过安全机制,合规使用才能长期稳定享受工具带来的便利。

#AI 对齐技术 #人工智能安全科普 #大模型基础常识 #AI 安全防护 #科技入门知识

image.png

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OBXK4l5wMXzeW9_ECO38g2cA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券