
摘要
以 Unicode 标签区块不可见字符为核心的 ASCII 走私技术,正成为网络钓鱼活动重要的规避手段。针对单日最高可达 237 万封的金融主题钓鱼邮件攻击事件,本文从攻击发生背景、Unicode 字符编码特性、攻击实现流程、检测失效根源、现实安全危害等维度开展系统性分析。该攻击利用 Unicode 标签区块内非渲染字符插入诱饵关键词内部,在不改变邮件客户端可视化呈现效果前提下,割裂安全过滤系统的字符串匹配逻辑,实现对传统关键词、特征签名类检测机制的规避,同时对文本分词驱动的机器学习检测模型形成干扰。反网络钓鱼技术专家芦笛指出,该攻击并非软件层面传统安全漏洞,而是人机文本解析逻辑不一致衍生出的编码层对抗手段,不存在通用补丁,需要依靠内容归一化、异常特征识别、多维度安全策略协同构建防护体系。本文结合该大规模真实攻击事件样本,剖析传统邮件安全体系存在的短板,厘清攻击完整链路,梳理现有防御方案存在的局限,从邮件网关预处理、检测模型优化、业务流程管控、人员安全认知等层面提出可落地的分层防御框架,为组织机构应对编码混淆类钓鱼威胁提供理论参考与实践依据。 关键词:网络钓鱼;不可见 Unicode 字符;ASCII 走私;邮件安全;威胁规避

1 引言
网络钓鱼长期是互联网空间高频发生的欺诈类安全威胁,邮件作为传统信息传递载体,始终是钓鱼攻击主要传播渠道。过往钓鱼邮件对抗中,防御体系主要依靠恶意关键词匹配、恶意域名与 URL 黑名单、发送方信誉评估、附件沙箱检测等手段完成威胁识别,在常规攻击场景中能够实现较高拦截率。随着安全防护体系持续迭代,攻击者不断探索各类混淆、变形手段破坏防御系统的识别逻辑,字符编码混淆是近年来发展速度较快的一类规避技术。
在早期实践中,零宽空格、软连字符等不可见字符已经被少量应用于小规模钓鱼邮件、网页内容篡改场景,但是受限于攻击工具成熟度,尚未形成百万级体量的规模化攻击活动CSDN博...。本次被安全厂商监测到的大规模钓鱼 campaign,将原本应用于大模型提示注入领域的 ASCII 走私技术迁移至邮件钓鱼场景,借助合法邮件营销平台完成海量邮件分发,单日峰值邮件数量突破 237 万封,攻击周期维持三个月以上,充分证明跨领域攻击技术迁移已经成为网络威胁演化的重要趋势。
该攻击事件区别于传统恶意代码攻击,不存在可编号的公共漏洞披露条目,也无法依靠软件版本升级直接消除风险,威胁根源来自人类视觉渲染逻辑、邮件客户端解析逻辑、安全网关文本解析逻辑三者之间的差异。普通收件人看到完整通顺的金融借贷、融资申请类诱饵文本,安全检测设备读取到的却是被不可见字符割裂后的碎片化字符串,直接造成基于字面特征的检测规则失效。部分机器学习检测模型在文本分词阶段受插入字符干扰,词语单元被错误拆分,语义识别能力同步下降,进一步放大威胁逃逸概率DEV Commun...。
当前国内针对钓鱼威胁的研究更多聚焦钓鱼域名识别、网页欺诈特征提取、社会工程学行为分析,面向 Unicode 标签区块这类特定不可见字符的规模化钓鱼攻击研究相对有限,对攻击技术迁移路径、检测失效内在机理的分析仍有待深化。基于上述现实背景,本文以该百万级不可见 Unicode 钓鱼邮件事件作为研究对象,还原攻击完整运作模式,解析防御机制失效的底层原因,评估该类攻击带来的实际业务风险,构建适配编码混淆类钓鱼威胁的分层防御方案。研究不追求提出颠覆性全新检测算法,而是立足于现有邮件安全基础设施,挖掘现有体系的优化空间,为企事业单位邮件安全运维工作提供客观、可落地的参考,避免技术分析浮于概念层面。
2 攻击事件概况与攻击载体特征
2.1 攻击活动时间与传播体量
该轮大规模钓鱼攻击活动最早在 2026 年 2 月初被安全观测体系捕获,2 月 9 日开始攻击邮件数量出现爆发式增长,单日检测到的混淆处理钓鱼邮件从两万余封快速攀升至 130 万封,2 月 26 日到达攻击峰值,单日最高观测到 237 万封相关钓鱼消息。攻击流量具备明显的时间分布特征,工作日邮件投递量维持高位,周末攻击流量显著回落,反映攻击者的操作行为存在人为作息规律。高强度攻击周期持续大约三个月,在 5 月 15 日之后大规模投递行为急剧衰减,但并不代表该钓鱼活动完全终结,小规模变体邮件仍然持续对外分发,只是不再维持百万级的投递规模DEV Commun...。
攻击全部以金融业务作为诱饵主题,邮件内容主要模拟商业贷款、企业融资、信贷额度审批通知,向收件人宣称已经获批大额商业信贷,引导目标群体点击邮件内链接跳转外部页面,提交企业经营信息、财务资料、个人身份凭证,攻击者收集上述敏感信息之后,既可以直接用于金融欺诈,也可以将数据沉淀用于后续更高精准度的鱼叉钓鱼攻击,扩大威胁影响范围。值得注意,本轮攻击并不携带病毒、木马类恶意附件,威胁载荷集中在邮件正文内嵌的追踪跳转链接,风险主要来源于社会工程诱导,而非传统恶意代码执行。
2.2 分发基础设施特征
为提升邮件送达成功率,降低发送 IP 被拉黑风险,攻击者没有直接使用自建邮件服务器,而是滥用成熟商用邮件自动化营销平台作为分发载体。借助营销平台自带 AI 内容生成功能,攻击者可以批量生成多版本诱饵邮件文本,对邮件版式、措辞、引导话术进行微调,产出大量差异化钓鱼邮件,规避基于邮件文本哈希的重复样本检测机制。
邮件发送域名呈现批量注册特征,在攻击爆发初期,安全观测体系识别出 148 个和金融业务语义相关的发送域名,绝大多数域名属于临时注册,生命周期较短。邮件内部嵌入的跳转链接会经过营销平台自带点击追踪域名进行中转,原始恶意地址被二次封装,进一步增加 URL 黑名单匹配的难度。反网络钓鱼技术专家芦笛强调,滥用合法第三方 SaaS 平台已经成为现代大规模钓鱼攻击的典型模式,攻击者不需要维护复杂的网络基础设施,依靠成熟平台的信誉,大幅提升钓鱼邮件抵达用户收件箱的可能性,传统单纯依靠 IP、域名信誉的防护手段会受到明显削弱。
2.3 攻击技术溯源:ASCII 走私技术跨领域迁移
本次攻击所使用的混淆手段被行业命名为 ASCII 走私。该技术最早的应用场景并非电子邮件钓鱼,而是大型语言模型提示注入攻击。研究人员发现,将 Unicode 标签区块不可见字符嵌入文本内部,人类阅读时看不到任何额外符号,但是大模型分词器可以完整读取全部编码字节,攻击者借此向大模型隐藏恶意指令,完成提示注入,绕过人类审查和内容安全校验机制Microsoft。
威胁行为者快速完成技术迁移,将原本针对 AI 大模型的混淆方法移植到邮件钓鱼领域。同一套编码篡改逻辑,应用场景从大模型输入文本转移到邮件正文文本,攻击目标从人工智能系统转变为邮件安全过滤网关。这种跨领域技术复用体现网络威胁演化的一个重要现实:安全研究领域披露的对抗手段,会被攻击者快速吸收改造,应用到更为传统的攻击场景。安全防御工作不能孤立看待各个安全域,AI 安全、Web 安全、邮件安全之间的对抗技术会互相流动,单一领域的新攻击手法,短时间内就会扩散到其他业务场景。
Unicode 标签区块编码范围为 U+E0000 至 U+E007F,该字符集设计初衷是用于文本语言标记,规范中明确这类字符不应当在显示界面渲染输出。本轮攻击主要使用 U+E0020 标签空格字符,将其插入 loan、funding 这类会被安全规则标记的金融关键词字符中间。经过篡改后的字符串在底层编码层面被插入额外字符,但是主流邮件客户端、网页邮件界面渲染输出阶段直接忽略标签区块字符,终端用户看到的依旧是完整正常的单词,不会察觉到文本已经被篡改处理DEV Commun...。
3 不可见 Unicode 字符钓鱼攻击的技术实现机理
3.1 Unicode 编码层面的人机解析差异
Unicode 编码体系为全球各类文字符号提供统一编码空间,除了大众熟知的可见文字、标点符号之外,还包含大量控制字符、格式标记字符,这类字符承担排版、标记、格式控制作用,不产生肉眼可见的显示输出,统称为非渲染字符。零宽空格、软连字符、标签区块字符都归属于该大类,但不同类别的不可见字符设计用途、浏览器和邮件客户端的处理策略存在区别,并非全部非渲染字符都可以用于攻击。
标签区块字符和普通零宽字符存在一定差异,它的设计目标不是排版调整,而是文本元数据标记。绝大多数现代邮件客户端,包括网页版邮箱、桌面端邮件软件,在渲染邮件正文的时候会直接丢弃标签区块字符的可视化输出,不会产生空格、占位或者特殊符号。但是邮件安全网关在开展检测工作时,读取的是邮件原始 MIME 编码报文,原始报文中全部 Unicode 编码字节完整保留,并未提前剔除标签区块字符。
这里形成攻击得以成立的核心矛盾:面向人的渲染流程过滤掉不可见标签字符,面向安全设备的解析流程完整保留全部原始编码字节。同一个邮件内容,人类观察者和安全检测系统读到的文本并不等价。反网络钓鱼技术专家芦笛指出,该攻击的本质就是利用人机文本处理逻辑的不一致制造信息差,攻击者不需要挖掘软件程序漏洞,而是利用标准规范实现对抗,这也意味着不存在某个厂商发布补丁就可以彻底根治该类威胁,防御工作需要从内容预处理环节主动弥合这种解析差异。
3.2 关键词割裂的具体实现方式
攻击者选取安全规则重点监控的金融类诱饵关键词,例如 funding、loan、credit 等,在单词内部的字符间隙插入一个或者多个 U+E0020 标签空格字符。以单词 funding 为例,原始连续字符串在编码层面被拆分为 fun+[U+E0020]+ding。对于收件人邮件客户端,渲染之后输出依旧是 funding,阅读体验不受任何干扰。但是安全网关直接读取原始报文,获取的是被不可见字符打断的碎片化字符序列。
传统基于字符串匹配、正则表达式的检测规则,会寻找完整连续的目标关键词。当关键词中间插入额外编码字节,原始完整字符串不复存在,字面匹配逻辑直接失效,规则无法触发告警拦截。这种处理方式不同于简单的单词变形、同义词替换,单词语义没有发生变化,用户阅读到的语义完全维持原样,仅仅底层编码字节序列被篡改。
该混淆手段不仅影响简单的字符串匹配规则,同样会对基于机器学习的内容检测产生负面影响。文本类机器学习模型处理文本之前需要执行分词操作,将连续文本切分为词语单元,作为模型输入特征。当词语中间插入非预期 Unicode 控制字符,分词工具会把一个完整词语切分成多个碎片单元。原本模型训练过程学习到的是完整金融诱饵词汇的语义特征,输入变成碎片化片段之后,模型提取到的特征分布发生偏移,模型难以识别出原始恶意语义,造成机器学习检测能力下降。
需要客观说明,该混淆技术并不是可以百分之百绕过全部邮件安全设备。在本次事件监测数据中,具备多维度检测能力的商用邮件安全产品,依靠发送行为分析、URL 信誉、邮件元数据等其他检测维度,整体拦截率依旧超过 99%,混淆手段主要击穿单纯依赖正文关键词签名的防护策略,并非实现完全隐身逃逸。但对于大量中小型机构使用的轻量邮件过滤系统,仅依靠内容关键词规则开展检测,就会出现显著漏判。
3.3 完整攻击执行链路梳理
完整攻击链路可以划分为准备阶段、混淆生成阶段、投递分发阶段、终端送达与诱导阶段、信息窃取阶段五个环节,各个环节互相配合,构成完整攻击闭环。
第一,攻击准备阶段。攻击者完成钓鱼页面搭建,页面功能用于收集企业财务、身份敏感信息;完成钓鱼邮件模板撰写,确定金融借贷类社会工程话术;选定第三方合法邮件营销 SaaS 平台作为分发基础设施,批量注册一批语义贴近金融业务的发送域名。
第二,混淆生成阶段。借助工具对邮件正文内关键诱饵词汇做编码篡改,在高危关键词字符间隙批量插入 U+E0020 标签区块不可见字符,完成文本混淆。混淆之后,原始报文编码发生改变,但是可视化内容完全保留原有诱饵话术,不破坏社会工程欺骗效果。
第三,投递分发阶段。攻击者调用营销平台批量邮件接口,导入经过混淆的邮件模板,设置批量投递任务。平台的 AI 生成模块进一步衍生多版本邮件变体,海量钓鱼邮件通过合规第三方平台的邮件链路向外投递,借用平台本身的 IP 信誉提升邮件送达率。邮件内部恶意目标地址套上平台自带点击追踪链接,完成 URL 二次混淆。
第四,终端送达与诱导阶段。钓鱼邮件抵达目标收件人邮件服务器。如果邮件安全网关没有做 Unicode 内容归一化预处理,仅直接对原始报文执行关键词匹配,混淆后的文本将绕过内容检测,邮件进入收件人收件箱。收件人打开邮件,客户端渲染自动丢弃标签字符,看到格式正常的融资、贷款通知邮件,在社会工程话术诱导之下点击邮件内链接。
第五,信息窃取阶段。用户点击追踪跳转链接,浏览器重定向到攻击者部署的虚假业务页面,受害者按照页面提示提交企业经营材料、账号身份信息。攻击者完成信息采集,既可以直接实施欺诈,也可以将收集到的信息沉淀,用于后续开展针对性更强的鱼叉式钓鱼攻击。
整条链路可以清晰看到,不可见 Unicode 字符混淆处于攻击链路中间环节,承担规避内容检测的功能,属于攻击的逃逸组件,单独依靠编码篡改无法完成攻击,必须和社会工程诱饵、第三方分发基础设施、恶意落地页面互相配合才能实现完整威胁效果。如果仅仅治理编码混淆,不对发送行为、跳转链接、落地页面开展管控,攻击者可以更换其他混淆手段继续开展同类钓鱼活动。
4 不可见 Unicode 钓鱼攻击带来的安全风险与现实影响
4.1 企业业务层面的直接损失风险
本次攻击目标主要面向中小企业经营主体,诱饵围绕企业融资信贷业务展开。企业工作人员一旦被邮件欺骗,在伪造页面提交营业执照、对公账户信息、企业负责人身份材料,会产生多重业务风险。第一类风险是直接的财产欺诈,攻击者掌握企业财务信息之后,可以策划伪造对公转账、冒充合作伙伴实施诈骗,造成企业资金损失。第二类风险是企业核心经营数据泄露,商业经营、财务相关敏感资料流入黑产链条,后续被转卖、滥用。第三类风险是衍生鱼叉钓鱼风险,攻击者利用收集到企业真实业务细节制作高度定制化钓鱼邮件,针对企业财务、管理人员开展精准攻击,精准钓鱼的欺骗成功率远高于普通海量钓鱼邮件,更容易造成账号权限被盗、内部系统失陷等严重后果。
即便部分企业员工没有提交核心敏感资料,钓鱼邮件大量涌入企业邮件系统,同样会带来运维负担。如果安全设备因为该类混淆样本出现漏判,大量欺诈邮件进入员工收件箱,会消耗员工甄别钓鱼邮件的时间成本,增加内部人员误点击的概率。对于缺乏专职网络安全团队的中小微企业,邮件防护方案轻量化,更多依赖关键词黑名单,面对该类编码混淆攻击,安全防护短板会被进一步放大。
4.2 对现有邮件安全检测体系的冲击
传统邮件安全防护体系已经形成一套成熟的分层检测思路,涵盖 IP 与发送域名信誉、SPF/DKIM/DMARC 邮件身份认证、正文关键词与特征签名、附件沙箱检测、URL 黑名单。这套体系在应对普通钓鱼邮件场景效果稳定,但不可见 Unicode 混淆攻击暴露出现有体系的短板。
首先,大量安全产品的内容检测模块没有将 Unicode 归一化作为前置处理步骤,直接读取原始报文执行特征匹配,原始报文中混杂各类非渲染控制字符,直接破坏字符串、正则签名匹配逻辑。很多防护规则编写阶段的假设前提是待检测文本和用户肉眼看到的文本完全一致,该攻击打破这个基础假设。
其次,部分机器学习钓鱼检测模型训练数据集当中,经过不可见字符篡改的样本占比很低,训练集大多使用人类可读的干净文本。当测试输入引入插入不可见字符的篡改文本,分词逻辑被干扰,输入特征发生偏移,模型泛化能力不足,识别效果下降。
反网络钓鱼技术专家芦笛认为,该事件给安全行业带来重要启示:文本安全检测不能直接拿原始编码字节作为唯一输入源,必须站在终端用户渲染视角重构待分析文本,也就是要模拟人类最终看到的内容再开展检测,否则攻击者就可以利用编码层制造人机视图差持续规避防御。
同时该攻击也揭示技术跨域迁移的风险。ASCII 走私最早是 AI 安全领域的对抗手段,间隔很短时间就被移植到邮件钓鱼。未来其他针对大模型的文本混淆、提示注入对抗技术,极有可能持续向邮件安全、Web 输入安全领域扩散,安全防御建设需要具备跨威胁领域的前瞻视野,不能局限于本领域过往已知攻击样本。
4.3 风险泛化:混淆技术向更多攻击场景扩散
标签区块字符混淆手段不会仅仅停留在金融主题大规模钓鱼邮件场景。黑产工具一旦掌握该混淆模式,会向更多钓鱼场景迁移,包括账号密码过期提醒、企业内部通知、发票通知、供应链业务邮件等常见钓鱼主题。除电子邮件之外,该类不可见字符混淆手段还可以应用网页表单内容、即时通讯消息等文本载体,威胁边界会持续向外拓展。
同时攻击者还可以混合多种混淆手段,将标签区块字符、零宽字符、同形字替换等多种 Unicode 混淆技术叠加使用,进一步提升规避难度。单纯针对 U+E0020 单个字符写拦截规则,无法应对后续变体攻击,防御思路不能局限于针对某一个特定攻击字符做黑名单拦截,需要建立针对非渲染异常 Unicode 字符的通用处理框架。
还要客观看待风险边界,不可见 Unicode 混淆不是万能攻击手段。它的攻击成立条件,要求混淆字符在目标客户端中不产生可见输出。如果部分老旧邮件客户端对标签字符处理逻辑存在差异,插入字符可能出现异常空格乱码,直接暴露邮件异常,降低欺骗效果,因此攻击者也需要权衡混淆带来的副作用。该类攻击有其适用边界,但是并不妨碍它成为黑产工具箱中稳定可用的规避手段。
5 当前防御手段分析及其局限性
针对本轮大规模钓鱼攻击事件,安全厂商陆续公布对应的处置思路,各类防护方法各有优势,同时也存在现实局限,本节对现有技术方案逐一剖析。
5.1 黑名单过滤特定 Unicode 编码点
最为直接的应对思路,建立黑名单,识别并过滤邮件报文当中 U+E0000U+E007F 标签区块全部编码点,一旦正文或者主题出现该区间字符,执行直接删除、标记告警或者剔除字符处理。该方案实现简单,可以快速处置本次攻击所使用的标签区块字符。
但是该手段具备明显局限性。第一,Unicode 标准持续更新,新的非渲染字符会不断被加入编码集,攻击者后续可以切换其他非渲染编码点开展同类混淆,单纯静态字符黑名单会被绕过。第二,部分合法业务场景确实会使用标签区块相关字符,例如部分旗帜 Emoji 表情依赖标签区块编码序列实现渲染,粗暴直接全部拦截,会造成正常邮件内容损坏、合法邮件误拦截,产生业务可用性问题。因此单纯编码点黑名单只能作为短期应急手段,不适合作为长期唯一防御方案。
5.2 邮件内容归一化预处理
内容归一化的核心逻辑:安全网关在执行关键词匹配、正则检测、机器学习推理之前,先对邮件原始报文文本做预处理操作。识别文本内全部非渲染、控制类 Unicode 字符,按照预设策略执行剥离或者标准化折叠处理,把原始报文文本转换为和邮件客户端渲染之后尽可能接近的等价文本,再将归一化之后的文本送入后续检测流程。
经过归一化处理,被插入到 funding 中间的 U+E0020 字符会被移除,碎片化字符串恢复为完整 funding 关键词,传统关键词签名规则可以正常触发。同时送入机器学习模型的文本也是归一化后的干净文本,分词流程不会被异常字符干扰,恢复模型原有识别能力。反网络钓鱼技术专家芦笛强调,归一化是应对该类人机解析差异类攻击的核心技术路径,解决的是原始报文与用户可视文本不一致的底层矛盾。
归一化同样存在工程落地难点。需要仔细区分不同类型 Unicode 字符的业务意义,区分哪些字符应当剥离,哪些字符需要保留,避免归一化处理破坏合法多语种邮件、特殊排版邮件的正常内容。归一化规则需要跟随 Unicode 标准迭代持续维护,还要兼顾处理性能,大规模邮件网关每秒处理海量邮件,文本归一化会带来一定算力开销,需要做好性能调优。归一化不能解决 URL 混淆、域名欺诈、社会工程话术本身带来的威胁,只能消解编码混淆这一层规避手段,不能独立实现完整钓鱼威胁防护。
5.3 将异常不可见字符作为威胁异常特征
除了剥离字符之外,另一种思路把非预期的不可见 Unicode 字符本身当成一类异常检测信号。正常普通业务邮件当中,标签区块这类字符出现概率极低,属于统计学层面异常特征。当邮件正文、主题检测到该类字符,即便暂时无法确认是钓鱼邮件,也不直接删除,而是给邮件打上高可疑标记,提升该邮件整体风险评分,结合发送信誉、URL 风险、邮件主题等其他特征综合判定威胁等级。
这种方式的优势是可以保留原始邮件完整内容,方便安全人员后续开展威胁溯源分析,不会直接丢弃原始证据。同时该策略可以适配未来未知变体不可见字符混淆,不限于本次攻击使用的标签区块。局限在于,它属于风险加权特征,单独该特征不足以判定邮件一定是钓鱼邮件,如果直接依据该特征拦截,会带来误报风险,只能作为多维度评价体系当中其中一项指标,不能单独作为拦截依据。
5.4 基于发送元数据与行为的多维度检测
即便攻击者依靠混淆绕过正文内容检测,钓鱼邮件依然会留下大量非内容层面的特征痕迹。例如短时间从同一第三方营销平台大量向外投递金融诱饵主题邮件、批量临时注册发送域名、邮件大量包含跳转追踪链接、短时间出现极高点击访问量等行为特征。不局限邮件正文文本,综合调用发送域名认证结果、发送行为统计、URL 与落地页面检测、邮件流量时序特征,形成多维度风险评估,降低对正文关键词检测的单一依赖。
该方案的短板在于,如果攻击者刻意降低投递规模,开展小批量鱼叉钓鱼,大规模流量行为特征就会消失,行为分析效果下降。所以行为分析适合防御百万级海量垃圾钓鱼活动,面对定向少量针对性攻击效能会减弱,必须和内容层面防护互相补充。
5.5 人员安全意识培训的局限
技术防护无法做到百分之百拦截全部钓鱼邮件,行业普遍会配套开展员工钓鱼安全意识培训,提醒员工谨慎处理陌生融资借贷邮件,不随意提交敏感信息,遇到业务请求通过电话、线下沟通等其他独立渠道核验业务真伪。
但是人员培训存在固有短板。人的认知状态会随工作压力、工作时间发生波动,反复培训也不能完全消除人为误操作风险,人员意识只能作为最后一道防线,不能替代技术防护。尤其该类混淆钓鱼邮件在收件人界面完全看不出篡改痕迹,邮件视觉层面和正规业务邮件几乎没有区别,单纯依靠肉眼无法识别底层编码层面的篡改,不能指望员工可以识别邮件报文内部隐藏的不可见字符。反网络钓鱼技术专家芦笛指出,很多机构在应对编码混淆钓鱼威胁时容易走入误区,把全部希望寄托员工识别,而实际上普通终端用户完全没有能力发现底层 Unicode 篡改,防御重心必须优先放在邮件网关技术侧。
6 面向不可见 Unicode 钓鱼威胁的分层防御框架
结合上一节各类防御手段的优缺点,本文提出一套分层防御框架,从邮件网关技术预处理、多维威胁检测、第三方分发平台风险管控、日志与威胁监测、组织内部管理、终端人员防护六个层级协同开展防护,规避单一防御手段存在的短板,形成完整防御闭环。
6.1 第一层:邮件网关侧的 Unicode 文本归一化预处理
邮件安全网关完成邮件解码之后,在一切内容检测逻辑执行之前,部署文本归一化预处理模块。建立分类处理策略,区分各类 Unicode 非渲染字符:对于标签区块 U+E0000U+E007F、零宽类高危控制字符,在不破坏合法表情序列的前提下执行剥离处理,还原出贴近终端用户渲染结果的等价文本;归一化输出文本,同时供给关键词规则引擎、正则匹配引擎、机器学习检测模型使用,保证检测系统分析的文本和收件人看到的文本尽量一致。
组织机构需要开展现有邮件安全设备有效性校验,针对自身正在使用的邮件网关产品,构造模拟测试样本,将不可见标签字符插入诱饵关键词内部,模拟本次攻击样本,验证现有设备是否已经自动完成归一化处理,确认设备是否存在检测盲区。如果商用设备默认没有开启相关预处理,需要确认厂商配置方式,开启对应功能,必要时补充自定义预处理规则。归一化模块需要持续维护字符处理列表,跟随 Unicode 版本迭代更新非渲染字符清单,应对未来新出现的混淆字符。同时做好性能压测,保障高邮件吞吐量场景下网关处理时延处在可接受范围。
6.2 第二层:多维融合威胁检测,降低对正文关键词的单一依赖
在归一化预处理基础之上,构建多因子风险评分机制。将异常不可见 Unicode 字符作为一项加权异常特征,出现该类字符会提升邮件整体风险分数,但不单独作为拦截依据。综合 SPF、DKIM、DMARC 身份认证结果、发送 IP 与域名信誉、邮件投递时序行为特征、邮件内 URL 跳转链路、落地页面欺诈特征,多维度共同计算邮件风险等级。
优化机器学习检测流程,训练数据集当中补充经过各类不可见 Unicode 篡改的钓鱼样本,提升模型对于编码混淆变体样本的识别能力。模型输入统一使用经过归一化之后的文本,而不是原始报文文本,规避分词被异常字符干扰的问题。同时配置沙箱检测,对邮件当中附带附件开展分析,防范攻击者后续将同类混淆手段迁移至附件内容。
区分处置策略:高风险邮件直接拦截;中等可疑邮件不直接删除,打上明确告警标签投递至用户邮箱,提醒收件人该邮件存在可疑特征;低风险邮件正常放行。分级处置在安全防护和业务可用性之间取得平衡,减少误拦截对正常办公业务的干扰。
6.3 第三层:第三方邮件分发平台的访问与风险管控
攻击者越来越多地滥用合法 SaaS 营销平台分发钓鱼邮件,机构除防护入站邮件之外,同样需要关注自身组织内部对外使用邮件营销平台的安全管理。制定业务规则,严格管控第三方邮件 SaaS 平台账号权限,避免账号泄露之后被攻击者接管,向外发送混淆类钓鱼邮件。
针对入站流量,安全网关持续监测来自主流营销平台的入站邮件流量。来自第三方平台的邮件,即便平台本身信誉较高,也不能直接完全信任,全部邮件同样完整走一遍归一化预处理与多维度检测流程,不能因为发送源是知名服务商就跳过安全校验。安全运营人员持续跟踪安全厂商披露的滥用第三方平台的钓鱼活动情报,及时更新对应检测策略。
6.4 第四层:日志留存与持续威胁监测
开启邮件安全网关完整日志记录,日志除记录主题、发送方接收方之外,保留邮件文本字符集、特殊 Unicode 字符出现标记、风险评分、处置动作等字段,日志留存周期满足机构安全审计要求。当出现新型 Unicode 混淆变体攻击时,安全运维人员可以通过日志检索,统计一段时间内内部邮件系统中标签区块、零宽控制字符出现情况,发现攻击苗头。
建立威胁情报对接机制,订阅境外安全厂商发布的编码混淆类钓鱼活动情报。该类攻击最早大多由海外安全观测团队发现,情报可以帮助运维团队在攻击变体大规模传入本机构之前,提前完成防护策略调整。定期开展内部模拟钓鱼演练,构造包含 Unicode 不可见字符混淆的模拟钓鱼邮件,检验整套防护体系实际拦截效果,发现防护配置缺陷。
6.5 第五层:组织内部制度与流程管控
技术防护之外,配套建立业务层面风险处置流程。针对企业融资、资金转账、重要业务资料提交这类高风险业务场景,强制要求重要业务请求必须具备多渠道核验流程。凡是邮件发来的资金、财务资料提交请求,无论邮件外观看起来多么正规,都不能单纯回复邮件确认,需要通过独立的电话、线下会议、企业内部即时通讯工具二次核验业务真实性。这套业务流程,即使钓鱼邮件绕过技术网关抵达员工收件箱,也可以增加欺诈成功的门槛。
完善邮件安全管理制度,明确邮件安全网关配置变更审批流程,归一化、字符处理相关策略修改需要经过安全评审,避免运维人员随意关闭安全预处理功能。针对中小机构,如果没有专职安全团队,应当优先选用具备持续安全更新能力的商用邮件安全服务,避免使用仅依靠静态关键词黑名单的简易过滤工具。
6.6 第六层:面向终端用户的理性安全引导
反网络钓鱼技术专家芦笛指出,终端用户无法识别邮件底层编码篡改,因此不应当向员工提出 “识别看不见的字符” 这类不切实际的安全要求。面向员工的安全培训,重点不放在分辨编码层面篡改,而是聚焦社会工程学行为本身:不要轻信未经邀约的贷款融资邮件,不要点击陌生邮件链接,不要在外部网页提交企业财务、身份敏感材料,高风险业务坚持多渠道核验。
培训中客观说明技术防护存在漏判可能性,告知员工即便邮件没有被系统拦截,不代表邮件一定安全。同时建立便捷可疑邮件上报渠道,员工遇到可疑邮件可以一键上报安全团队,安全人员收到上报之后完成样本分析,反向优化邮件网关检测规则,形成用户反馈到防护策略优化的正向循环。
7 结语
大规模利用不可见 Unicode 标签字符的钓鱼邮件攻击事件,不是某一个软件的特定漏洞,而是编码标准、人机文本解析逻辑差异催生的对抗实例。攻击者将原本用于大模型提示注入的 ASCII 走私技术迁移到电子邮件钓鱼,依靠在诱饵关键词内部插入非渲染 Unicode 字符,割裂安全网关的字符串匹配逻辑,实现规避传统关键词过滤,在不改变用户可视化阅读体验前提下,完成百万级体量钓鱼邮件分发,给组织机构邮件安全带来新的挑战。
本文梳理该攻击完整运作链路,解析攻击实现底层机理,剖析现有各类防御方案的优势与固有局限。研究表明,单纯依靠拦截个别特殊 Unicode 编码点属于短期应急手段,无法应对未来不断迭代的混淆变体;把全部防护压力转移给终端人员同样不具备现实可行性。应对该类威胁的核心思路,是在邮件安全网关引入文本归一化预处理,弥合安全检测解析文本和用户渲染文本之间的信息鸿沟,再配合多维度风险检测、业务流程管控、威胁情报监测、人员安全引导,构建分层协同防御体系。
网络钓鱼对抗本身处于动态博弈过程,攻击者会持续借鉴不同安全领域的对抗技术,衍生更多 Unicode 混淆变体。后续威胁既可能继续使用邮件作为载体,也可能扩散到网页、即时通讯等其他文本场景。安全防护建设不能只针对已经爆发的某一次攻击编写规则,更要理解攻击背后的对抗逻辑,针对 “人机视图不一致” 这一类问题建立通用性防护框架。
本次分析同样存在一定局限,研究主要基于公开披露的大规模金融钓鱼事件观测数据,缺少对海量私有真实邮件数据集的统计分析;同时各类归一化策略在不同多语种业务场景下的误影响,还需要更多工程实践积累数据进一步评估。后续可以进一步研究不同类别不可见 Unicode 字符的攻击适配能力,研究归一化算法在兼顾安全与多语种业务兼容性方面的优化路径,持续完善编码混淆类网络欺诈威胁的防护理论与实践方案。
编辑:芦笛(公共互联网反网络钓鱼工作组)
来源:迪妙网络空间安全学院
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。