AI 助手越聪明,越容易被网页里的隐藏指令骗。
问题出在通道混了:系统指令和网页数据全变成一串文本。模型没法分清哪句该听、哪句只是资料。
直接对话还能控范围:用户顶多套出点提示词。但要是把恶意指令藏在网页或邮件里,就麻烦了。
间接注入才是真危险:只要 AI 去读,就会中招。微软的 Copilot 就被坑过。一封带隐藏代码的邮件,能让它在后台偷发邮件。连安全过滤都没拦住。要是给 AI 开了运行代码的权限,风险更大。
老办法防不住:让模型“忽略恶意指令”没用。它俩都在同一个通道里吵。加过滤器或者分隔符也容易被绕过去。
解法得靠外部把关:别让 AI 自己管自己。让它只干读资料的脏活,别碰工具钥匙。真正调用工具的活,交给普通代码审批。高危操作必须人工确认,还得收紧权限。
说白了,底层架构不改,这漏洞就堵不死。用 AI 可以,但千万别把万能钥匙交给它。