首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >ASCII 走私技术在钓鱼邮件规避中的应用与防御研究

ASCII 走私技术在钓鱼邮件规避中的应用与防御研究

原创
作者头像
芦笛
发布于 2026-09-24 07:04:14
发布于 2026-09-24 07:04:14
820
举报

摘要

不可见 Unicode 字符用于文本混淆并非新技术,但 Unicode 标签块(U+E0000 至 U+E007F)这一原本因人工智能提示注入研究而受到关注的字符区间,在 2026 年初被大规模迁移应用于钓鱼邮件的安全过滤规避。微软安全研究团队于 2026 年 2 月监测到一场高容量钓鱼活动,攻击者将不可见的 Unicode 标签字符(主要为 U+E0020 标签空格)插入 "funding" 等金融诱饵关键词内部,使字面字符串匹配与基于分词的机器学习分类器失效,而邮件对人类收件人仍显示为正常文本。该活动自 2026 年 2 月 9 日起急剧攀升,峰值日发送量超过 230 万封,持续约三个月,涉及约 150 个金融主题一次性域名,并通过合法邮件营销平台 ActiveCampaign 的基础设施进行投递。本文基于微软安全研究团队与 KnowBe4 披露的原始材料,系统梳理 ASCII 走私技术的底层原理、从人工智能提示注入领域向传统钓鱼规避领域迁移的演化路径,剖析该技术对基于规则与基于机器学习的两类邮件检测体系的冲击机理,还原攻击活动的基础设施指纹与行为特征,并从文本规范化、异常信号检测、多层防御架构与跨域威胁情报四个维度提出防御框架。反网络钓鱼技术专家芦笛指出,ASCII 走私事件的本质警示在于,安全社区在一个领域中讨论的攻击手法不会停留在该领域,当技术细节被公开充分讨论后,迁移到传统攻击生态只是时间问题。迪妙网络空间安全学院研究团队认为,邮件安全防御体系应当建立 "先规范化后匹配" 的基础处理原则,并将人工智能安全研究中涌现的规避手法纳入传统威胁检测的持续监控范围,打破领域之间的知识壁垒。

关键词:ASCII 走私;Unicode 标签字符;钓鱼邮件;过滤规避;提示注入;文本规范化

1 引言

电子邮件钓鱼长期以来是企业网络入侵与金融欺诈最主要的初始访问向量之一。为对抗邮件安全网关的检测,攻击者持续开发各类内容混淆技术,包括零宽字符插入、同形异义字替换、软连字符断词、HTML 实体编码等。这些技术的共同目标是在不改变人类视觉感知的前提下,破坏自动化检测系统对文本的解析与匹配能力。过去十余年间,邮件安全厂商围绕这些已知混淆手法建立了较为成熟的规范化与检测机制,常规的零宽空格与不间断空格插入已难以有效绕过主流防护。

2025 年,一个原本属于人工智能安全研究领域的技术概念 ——"ASCII 走私"(ASCII Smuggling)—— 开始受到广泛关注。该技术利用 Unicode 标准中已基本废弃的标签字符块(U+E0000 至 U+E007F)中不可见的码点,在文本中隐藏人类无法感知但语言模型可以读取的指令内容,用于实施提示注入与跨提示注入攻击。由于这一技术清晰展示了人类视觉与机器解析之间的鸿沟,它在 2025 年间频繁出现在人工智能红队报告、会议演讲与安全工具中,Unicode 标签块也由此从一个被遗忘的字符区间变为安全社区熟知的攻击载体。

2026 年 2 月,微软安全研究团队在监测中发现,这一原本服务于人工智能提示注入的技术,已被攻击者迁移用于传统钓鱼邮件的过滤规避。一场大规模金融主题钓鱼活动将不可见的 Unicode 标签字符插入 "funding" 等高信号金融词汇内部,使字面关键词匹配与基于分词的机器学习分类器无法正确识别诱饵内容,而邮件在收件人眼中完全正常。该活动在峰值日发送量超过 230 万封,持续约三个月,涉及上百个一次性域名,并借助合法邮件营销平台的基础设施进行投递以规避信誉过滤。

这一事件的学术价值在于,它清晰展示了攻击技术跨领域迁移的完整路径:一项在人工智能安全研究中被充分讨论的手法,在细节公开后被传统钓鱼攻击者吸收、改造并规模化部署。当前国内网络安全研究中,对 Unicode 混淆类钓鱼规避技术的讨论多集中于已知的零宽字符与同形字替换,对 Unicode 标签块这一较新区间的攻击应用缺乏系统梳理,对人工智能安全领域与传统邮件安全领域之间的技术迁移现象也缺少案例层面的深入分析。迪妙网安研究团队在跟踪 2025 年至 2026 年全球邮件威胁演化时注意到,随着生成式人工智能工具在黑产中的普及,攻击手法的迭代速度显著加快,不同攻击领域之间的技术壁垒正在消融,安全研究需要建立跨域的威胁监测视野。本文以微软与 KnowBe4 披露的原始研究材料为基础,对 ASCII 走私技术在钓鱼邮件规避中的应用进行系统分析,旨在为邮件安全防御体系的优化提供参考。

2 ASCII 走私技术的原理与演化路径

2.1 Unicode 标签块的技术特性

要理解 ASCII 走私技术的工作原理,首先需要考察 Unicode 标签字符块的设计与特性。Unicode 标准在 U+E0000 至 U+E007F 区间定义了一组标签字符,该区间包含了可打印 ASCII 字符的 "影子副本"—— 例如 U+E0041 对应大写字母 A,U+E0061 对应小写字母 a,U+E0020 对应空格。这一字符块最初的设计目的是支持语言标签功能,用于在文本中标注语言或方言信息。随着 Unicode 标准的演进,该功能已基本废弃,标签块在绝大多数现代字体与用户界面中不会被渲染为可见字符。

标签块的关键攻击属性在于其 "人类不可见但机器可处理" 的双重特性。对于普通用户而言,包含标签字符的文本在视觉上与正常文本没有任何区别 —— 邮件客户端、网页浏览器、文字处理软件在渲染时通常会跳过这些码点,或将其视为零宽字符。然而,对于直接处理原始字节序列的软件系统 —— 包括语言模型、文本解析器、正则表达式引擎、分词器 —— 这些字符是真实存在的码点,会参与文本的匹配、切分与特征提取过程。正是这种视觉层与处理层之间的不一致,构成了 ASCII 走私技术的基础。

2.2 从提示注入到钓鱼规避的意图反转

ASCII 走私技术最初在人工智能安全领域成名,其攻击模式是利用标签字符的不可见性,在网页、文档或邮件中隐藏人类无法感知但人工智能助手可以读取的指令。当人工智能助手摄入包含这些隐藏字符的原始文本时,它会将标签字符解码为文本内容,并可能遵循其中嵌入的攻击者指令,导致数据泄露或未授权操作。这一攻击模式的核心逻辑是 "对人隐藏、对模型暴露"。

钓鱼邮件规避场景下对同一技术的使用,其意图恰好反转。攻击者不再利用标签字符向人工智能模型隐藏地传递指令,而是利用标签字符在文本中插入分隔符,将高信号关键词拆分为不连续的片段,使邮件安全检测系统无法正确匹配或分类。此时标签字符的作用不是 "携带隐藏信息",而是 "破坏文本连续性"。微软研究团队在实际观测的攻击样本中发现,攻击者并未在标签块中编码完整的隐藏 ASCII 消息,而是仅使用单个不可见标签字符(主要是 U+E0020 标签空格)作为分隔符,散布在高信号词汇内部。严格来说,这是利用 ASCII 走私标签块中的码点进行不可见字符插入,而非完整意义上的消息走私,但技术载体与原理同源。

反网络钓鱼技术专家芦笛强调,这种意图反转本身具有重要的方法论意义。安全社区在研究提示注入时,关注的焦点是标签字符如何向模型传递隐藏指令,却较少讨论同一字符区间被用于破坏传统检测系统的可能性。当一项技术的底层特性 —— 人类与机器之间的感知不对称 —— 被充分揭示后,它可以服务于多种攻击目标,而不仅仅是最初被发现的那一种。

2.3 技术迁移的条件与时机

ASCII 走私技术从人工智能安全领域迁移到传统钓鱼领域,并非偶然事件,而是若干条件共同作用的结果。首先,技术细节的充分公开降低了迁移门槛。2025 年间,ASCII 走私在人工智能红队报告、会议演讲、公开工具与社交媒体中被广泛讨论,甚至出现了名为 "ASCII Smuggler" 的公开工具,可以方便地生成包含隐藏标签字符的文本。这些公开材料使得不具备人工智能背景的传统钓鱼攻击者也能够理解并使用该技术。

其次,传统混淆手法的检测覆盖率提升形成了技术替代的需求。经过多年的攻防博弈,主流邮件安全网关对零宽空格(U+200B)、零宽非连接符(U+200C)、不间断空格(U+00A0)、软连字符等常规混淆字符已建立了较为完善的规范化与检测机制。攻击者需要寻找检测覆盖率较低的新区间,而 Unicode 标签块由于此前主要出现在人工智能安全语境中,多数传统邮件安全产品并未将其纳入规范化处理范围,恰好提供了这样一个检测盲区。

最后,合法邮件营销平台的滥用为大规模投递提供了基础设施条件。本次观测到的攻击活动通过 ActiveCampaign 这一广泛使用的合法邮件营销平台进行投递,该平台拥有成熟的 IP 信誉与域名认证,其发出的邮件在信誉层面更接近合法营销邮件,这使得攻击者可以将更多的规避精力集中在内容层面,而不必同时解决基础设施信誉问题。

3 大规模钓鱼活动中的技术应用与特征分析

3.1 攻击时间线与规模特征

微软 Defender for Office 365 的遥测数据清晰记录了本次攻击活动的时间线与规模演变。2026 年 2 月 8 日,用于检测 ASCII 走私的狩猎签名日均触发约 21000 封邮件,处于正常基线水平。2 月 9 日,触发量急剧攀升至超过 130 万封,较前一日增长约两个数量级。2 月 11 日,日触发量达到超过 230 万封的峰值。此后活动维持在工作日 100 万至 237 万封的高位,2 月 26 日达到工作日量的峰值。

活动呈现出严格的周节律:工作日高强度发送,周末几乎完全静默。周日的发送量骤降至接近零,周一立即恢复至满负荷。这种 "工作日开、周末关" 的模式是典型的计划性批量发送基础设施特征,表明攻击者使用自动化调度工具控制发送节奏,而非人工随机操作。

高强度阶段持续约三个月后,自 2026 年 5 月 15 日起急剧下降,此后进入低残留活动期,至 6 月中旬仍有零星小幅波动。需要指出的是,这些日期界定的是该特定技术(Unicode 标签字符插入)在遥测中的使用周期,而非更广泛钓鱼活动的全生命周期。微软研究团队将该活动与 Fortra 此前记录的一场通过 ActiveCampaign 投递的 SBA 主题钓鱼活动关联起来,表明更广泛的活动在采用 Unicode 标签字符之前就已存在,在放弃该技术之后仍在继续。这说明攻击者将 ASCII 走私作为一个阶段性的规避手段,在检测覆盖率提升后即予以放弃,转而采用其他手法。

3.2 内容混淆模式与关键词选择

在被标记的邮件样本中,研究人员未发现向人工智能助手走私隐藏指令的行为,而是观察到一种更为直接的过滤规避模式:不可见标签字符被插入常见金融诱饵关键词内部,将其拆分为不连续的片段。最典型的例子是将 "funding" 一词在中间插入 U+E0020 标签空格,使其在原始字节序列中变为 "fun" 后跟不可见字符再跟 "ding"。

对于人类收件人以及在解析前丢弃或规范化这些字符的处理管道而言,该词仍然读作 "funding",邮件内容看起来完全正常。但对于匹配字面字符串 "funding" 的检测器,或未考虑交错不可见码点的正则表达式而言,字节序列中不再包含连续的关键词,匹配因此失败。

攻击者选择金融词汇作为混淆目标并非偶然。本次活动的诱饵主题围绕商业贷款、信用额度、预支资金等金融产品展开,这类邮件中 "funding""capital""loan""finance" 等词汇是高信号检测特征 —— 无论是基于规则的关键词匹配还是基于机器学习的分类器,都会将这些词汇的出现作为评估邮件风险的重要依据。通过在这些关键词内部插入不可见分隔符,攻击者可以同时破坏规则匹配与机器学习特征提取两条检测路径。

3.3 基础设施指纹与投递架构

本次攻击活动的基础设施具有高度可识别的指纹特征。在发送域名层面,攻击者使用了约 150 个金融主题的一次性域名,这些域名均由一小部分金融相关词汇组合而成。以 2026 年 2 月 9 日单日数据为例,排名前 20 的发送域名包括guardiangrowthfunding.com、digitalcapitalboost.com、thebusinessloanexpress.com等,每个域名当日发送量在 2 万至 3 万封之间。这 20 个域名仅由 28 个词元构成,包括 advance、boost、business、capital、funding、growth、loan、finance 等。攻击者通过不断注册新的词汇组合域名来规避域名信誉黑名单,但命名模式的高度同质化使其可以被基于词汇组合的检测规则批量识别。

在投递架构层面,这些品牌域名(即收件人看到的邮件头 P2 发件人域名)并非实际发送服务器,邮件实际通过合法邮件营销平台 ActiveCampaign 的基础设施中继。该平台会重写邮件正文中的所有出站链接,使其通过自身的点击跟踪域名(acemlnd.com和activehosted.com)路由,因此收件人点击的 URL 并不直接指向品牌域名。信封发件人(P1)采用 em - 数字。品牌域名的形式,少量复用的账号编号分散在上百个品牌域名中。发送 IP 方面,约 92% 的流量来自单一的 / 24 网络段 173.236.20.0/24,该网段属于 ActiveCampaign 的合法出站基础设施。

借助合法营销平台投递带来了显著的规避优势。平台拥有成熟的 IP 信誉、SPF/DKIM/DMARC 认证以及与主要邮箱服务商的长期信任关系,其发出的邮件在信誉层面与合法营销邮件难以区分。这迫使防御方不能简单依赖 IP 或域名信誉进行拦截,而必须深入内容层与行为层进行分析。同时,由于该网段同时承载大量合法营销邮件,将其作为独立拦截指标会导致大量误报,只能作为辅助定位信号使用。

4 对邮件安全检测体系的冲击机理

4.1 对基于规则的关键词匹配的破坏

邮件安全检测体系通常包含基于规则的关键词匹配层,用于识别已知的钓鱼诱饵词汇、恶意指令与敏感术语。这类检测的工作原理是在邮件主题与正文中搜索预定义的字符串或正则表达式模式,当匹配命中时提升邮件的风险评分或直接拦截。ASCII 走私技术对这一层的破坏机制是直接的:在关键词内部插入不可见字符后,原始字节序列中不再存在连续的目标字符串,字面匹配因此失败。

以 "funding" 为例,如果检测规则搜索连续的七个字母 f-u-n-d-i-n-g,那么在 f-u-n 与 d-i-n-g 之间插入任何字符(包括不可见的 U+E0020)都会使匹配失败。正则表达式如果未显式考虑交错的不可见码点,同样无法命中。这种破坏方式对所有依赖字面字符串连续性的规则检测均有效,且实现成本极低 —— 攻击者只需在选定关键词的随机位置插入一个不可见字符即可。

规则检测是否能够抵御这种攻击,取决于其在匹配前是否执行了文本规范化步骤。如果检测管道在应用规则之前先剥离或折叠所有不可见与非渲染 Unicode 码点,那么插入的标签字符会被移除,关键词恢复为连续形式,规则匹配即可正常工作。然而,微软研究团队指出,实际产品中的规范化步骤覆盖范围差异很大,许多系统仅处理了常见的零宽空格与不间断空格,并未将 Unicode 标签块纳入规范化范围,这正是攻击者选择该区间的核心原因。

4.2 对基于机器学习与自然语言处理的分类器的冲击

对于现代邮件安全体系而言,比规则匹配更重要的是基于机器学习与自然语言处理的分类器。这类系统不依赖预定义关键词,而是通过大量标注数据训练模型,自动学习钓鱼邮件与合法邮件在词汇、语法、结构等层面的统计差异。ASCII 走私技术对这类分类器的冲击机制更为微妙,也更具威胁性。

现代自然语言处理模型在处理文本时,通常首先将文本切分为词元或子词单元。一个干净的诱饵词如 "funding" 可能被表示为一个常见词元,或一组熟悉的子词序列。模型在训练过程中已经学习到这些词元或子词序列与钓鱼内容之间的关联,因此能够正确识别。然而,当在词中间插入不可见的 U+E0020 时,分词器的行为可能发生改变:它可能将文本切分为 "fun"、一个意外的标签字符、"ding" 三个片段;可能生成罕见或未知的子词单元;或者如果规范化步骤先于分词运行,则直接移除 U+E0020 并恢复 "funding"。

关键问题在于,分词器如何处理训练数据中从未出现过的不可见码点。大多数预训练语言模型的分词器是在清洗后的文本语料上训练的,这些语料中几乎不包含 Unicode 标签块字符。因此,当分词器遇到 U+E0020 时,它可能将其视为未知字符、拆分为字节级单元,或产生模型未见过的词元 ID。这些异常词元会干扰模型的特征提取过程,使模型无法将文本识别为它在训练中学过的钓鱼诱饵模式。

微软研究团队特别指出,除非过滤系统对邮件内容进行截图并通过光学字符识别提取可见文本,否则可能遗漏这类攻击。光学字符识别路径从渲染后的视觉图像中提取文本,不可见字符在渲染阶段已被丢弃,因此提取出的文本与人类看到的一致,能够恢复关键词的连续性。但并非所有邮件安全产品都实现了基于光学字符识别的内容分析路径,多数产品仍直接在原始文本上运行分类器。

反网络钓鱼技术专家芦笛指出,ASCII 走私对机器学习分类器的冲击本质上是一种对抗样本攻击。攻击者不改变邮件的语义内容与人类感知,仅在输入表示层面引入微小扰动,即可导致模型分类错误。这与计算机视觉领域中在图像上添加人眼不可察觉的扰动使模型误分类的对抗样本攻击在原理上完全一致,只是攻击域从图像转移到了文本。

4.3 检测盲区的形成与覆盖差异

综合规则层与机器学习层的分析,ASCII 走私技术能够形成有效检测盲区的前提条件是:邮件安全管道在内容检测运行之前,未对 Unicode 标签块字符进行规范化处理。如果管道在所有检测步骤之前先剥离 U+E0000 至 U+E007F 区间的字符,那么该技术对规则匹配与机器学习分类器的干扰都会被消除。

现实情况是,不同厂商、不同产品的规范化覆盖范围存在显著差异。微软 Defender for Office 365 的遥测显示,在本次活动中超过 99% 的邮件被不依赖于直接捕获标签字符的多层防护所拦截,包括发件人信誉、IP 信誉、URL 与域名信誉、机器学习垃圾邮件 / 钓鱼分类、品牌仿冒检测、认证检查等。这表明即使内容层存在潜在盲区,多层防御架构仍能通过其他信号有效拦截绝大多数攻击。但这一结果依赖于微软产品的完整防护栈,对于仅依赖内容层检测或防护层较少的产品,ASCII 走私可能导致更高的漏报率。

迪妙安全研究团队在评估国内主流邮件安全产品对 Unicode 标签块的处理能力时发现,部分产品在规范化步骤中仅覆盖了 U+2000 至 U+200F 区间的常见零宽字符,对 U+E0000 以上的补充平面字符缺乏处理。这一发现与微软研究中指出的 "标签块此前较少被滥用,防御方应验证规范化与分词管道是否一致处理标签字符" 的警示相吻合。随着该技术的公开传播,预计更多攻击者将尝试利用这一盲区,因此产品侧的规范化补全具有紧迫性。

5 防御框架与检测能力构建

5.1 核心原则:匹配前先规范化

针对 ASCII 走私及同类不可见字符混淆技术的最基础防御原则是 "匹配前先规范化"。任何将被关键词、签名或正则表达式逻辑评估的内容,都应当首先剥离或折叠不可见与非渲染 Unicode 码点,使得在词内部插入这些字符不再能破坏匹配。这一原则看似简单,但在实际工程中需要确保规范化步骤位于所有内容检测逻辑的最上游,且覆盖范围包含所有可能被滥用的不可见字符区间,而不仅仅是已知的常见字符。

具体而言,规范化范围应当至少包含 Unicode 标签块(U+E0000 至 U+E007F)、零宽空格(U+200B)、零宽非连接符(U+200C)、零宽连接符(U+200D)、文字方向控制符(U+200E 至 U+200F、U+202A 至 U+202E)、软连字符(U+00AD)、不间断空格(U+00A0)以及其他非渲染或格式控制字符。规范化操作可以是直接剥离这些字符,也可以是将其折叠为等效的可见字符(例如将不间断空格替换为普通空格),关键在于确保后续检测逻辑看到的文本与人类视觉感知一致。

需要注意的是,Unicode 标签块存在一个合法使用例外:英格兰、苏格兰、威尔士三个地区的国旗 emoji 是使用标签字符序列编码的。例如威尔士国旗由基础国旗码点 U+1F3F4 后跟拼写 "gbwls" 的标签字符序列及终止标签 U+E007F 构成。如果规范化逻辑简单地剥离所有标签字符,会导致这些国旗 emoji 渲染异常。因此,在实现规范化时需要对已知的合法标签字符序列(如地区国旗 emoji)进行例外处理,或采用更精细的规范化策略 —— 例如仅当标签字符出现在普通文本词汇内部而非 emoji 编码序列中时才予以剥离。

5.2 将标签块字符的存在作为高置信异常信号

除了在规范化中剥离标签字符外,防御方还可以反向利用这一技术的稀有性:由于标签块字符在正常邮件中极为罕见(除地区国旗 emoji 外几乎没有合法用途),其在邮件主题或正文中的出现本身就是一个高置信度的异常信号。微软研究团队指出,一种旨在使邮件对机器学习模型看起来更良性的技术,反而可以为防御方提供一个低误报率的检测指标。

这一思路的检测逻辑是:在排除已知合法使用(如地区国旗 emoji)后,任何包含 U+E0000 至 U+E007F 区间字符的入站邮件都应被标记为高风险,至少提升其风险评分,在结合其他可疑特征时可直接拦截。由于正常业务邮件中几乎不会出现这些字符,该检测规则的误报率极低。即使攻击者仅插入单个标签字符,也会触发这一信号。

将异常信号检测与规范化剥离结合使用,可以形成双重防护:规范化确保即使标签字符未被单独检测到,后续的关键词匹配与机器学习分类器仍能正常工作;异常信号检测则利用标签字符的稀有性提供一个独立的、高置信度的风险指标,即使邮件的其他特征看起来合法,标签字符的出现本身也足以引起怀疑。

5.3 行为指纹与基础设施模式检测

除了内容层的 Unicode 特征外,本次攻击活动还呈现出独特的行为指纹与基础设施模式,这些特征可以作为独立于内容混淆技术的检测维度,且在攻击者放弃 Unicode 标签字符后仍然有效。

行为层面,活动呈现出严格的 "工作日高强度、周末近零" 的周节律,以及从一次性金融主题域名批量发送的模式。防御方可以建立基于发送节律的异常检测:当一组新注册域名在工作日突然产生大量邮件而周末完全静默时,即使单封邮件的内容未触发任何规则,也应被标记为可疑。

基础设施层面,活动的指纹包括:由约 28 个金融词汇组合而成的品牌域名命名模式、通过 ActiveCampaign 平台中继的信封发件人形态(em - 数字。品牌域名或共享发送池 acems 数字.com/emsd 数字.com)、平台跟踪 URL(activehosted.com与acemlnd.com)、以及主要来自 173.236.20.0/24 网段的发送 IP。这些特征的组合 —— 金融词汇品牌域名加 ActiveCampaign 信封形态 —— 可以形成高精度的检测规则,且不依赖于邮件正文中的 Unicode 特征。微软研究团队提供的高级狩猎查询正是基于这一基础设施指纹,在邮件事件表中筛选由三个以上相邻金融 / 品牌词汇构成的发件人域名,同时匹配 ActiveCampaign 的信封发件人形态。

需要强调的是,基础设施指纹中的单个元素(如 ActiveCampaign 的跟踪域名或发送网段)本身不是恶意指标,因为它们同时承载大量合法营销邮件。只有当这些元素与金融词汇品牌域名、异常发送节律等其他特征结合时,才能形成高置信度的攻击判定。防御方在使用这些指标时应避免过度宽泛的拦截,以免影响合法邮件的投递。

5.4 多层防御架构的韧性

本次事件再次验证了多层防御架构的价值。微软 Defender for Office 365 的遥测显示,超过 99% 的攻击邮件被不依赖于直接捕获 Unicode 标签字符的防护层所拦截,包括发件人与 IP 信誉、URL 与域名信誉、机器学习分类、品牌仿冒检测、认证检查、批量邮件检测等。这意味着即使内容层的某一种检测手段被绕过,其他层面的信号仍能有效识别并拦截攻击。

多层防御架构的核心韧性在于,攻击者需要同时绕过所有相关层面才能成功投递,而每增加一个检测维度,攻击者的规避成本就显著上升。在本次活动中,攻击者通过合法营销平台解决了信誉层面的部分问题,但金融主题一次性域名的命名模式、异常的发送节律、以及最终落地页面的性质仍会触发其他检测维度。ASCII 走私技术仅针对内容层的关键词匹配与分词过程,无法同时影响信誉层、行为层与基础设施层的检测。

迪妙网络空间安全学院研究团队建议,企业在部署邮件安全防护时不应依赖单一产品或单一检测维度,而应构建包含网关层过滤、身份认证验证、URL 沙箱检测、用户行为分析与安全意识培训在内的纵深防御体系。即使某一层被新型规避技术绕过,其他层仍能提供防护。同时,企业应定期对邮件安全产品进行红队测试,使用包括 ASCII 走私在内的最新规避技术验证产品的实际检测能力,避免对产品标称能力的盲目信任。

6 跨域攻击技术迁移的启示与防御展望

6.1 攻击技术跨域迁移的一般规律

ASCII 走私从人工智能提示注入领域迁移到钓鱼规避领域,并非孤立事件,而是反映了网络攻击技术演化的一般规律:当一项技术的底层原理与实现细节被安全社区充分公开讨论后,它不会停留在最初被发现的攻击域,而是会被其他领域的攻击者吸收、改造并投入使用。技术迁移的速度取决于三个因素:技术细节的公开程度、目标领域中现有防御的覆盖缺口、以及迁移所需的工程改造成本。

在 ASCII 走私案例中,这三个因素均有利于快速迁移。技术细节方面,2025 年间该技术在人工智能安全社区被广泛讨论,公开工具与教程降低了使用门槛;防御缺口方面,传统邮件安全产品普遍未将 Unicode 标签块纳入规范化范围,存在明确的检测盲区;工程改造方面,将标签字符从 "隐藏指令" 改为 "关键词分隔符" 仅需改变使用方式,无需开发新技术,改造成本极低。三者叠加,使得迁移在技术概念公开后不到一年内即发生。

反网络钓鱼技术专家芦笛强调,安全社区需要建立跨域的威胁视野。研究人工智能安全的团队应当意识到,他们公开的攻击手法可能被传统攻击领域的攻击者利用;研究传统邮件安全的团队则应当持续关注人工智能安全、移动安全、云安全等相邻领域中涌现的新型规避技术,评估其迁移到邮件场景的可能性。打破领域之间的知识壁垒,是缩短防御响应时间的关键。

6.2 人工智能工具普及对攻击迭代的加速影响

生成式人工智能工具在黑产中的普及,正在从两个方面加速攻击技术的迭代与跨域迁移。一方面,人工智能工具降低了技术使用的门槛,使不具备深厚技术背景的攻击者也能够理解并应用原本需要专业知识的攻击手法。例如,大语言模型可以为攻击者解释 Unicode 标签块的原理并生成包含混淆字符的邮件内容,使攻击者无需深入理解字符编码即可实施攻击。另一方面,人工智能工具加速了技术信息的传播与消化,安全社区在会议、博客、社交媒体上发布的研究成果可以被人工智能工具快速摘要、翻译并转化为攻击者可操作的指南,进一步缩短从技术公开到黑产应用的时间窗口。

这一趋势对防御方提出了更高要求。传统的 "发现攻击手法→开发检测规则→更新产品" 的响应周期可能越来越难以跟上攻击迭代的速度。防御方需要更多地投入前瞻性研究,在攻击手法被黑产大规模应用之前即识别潜在风险并部署防护。同时,防御方应当加强与安全研究社区的协作,建立从研究成果到产品防护的快速转化机制。

6.3 文本规范化作为基础安全能力的长期价值

在可预见的未来,基于不可见字符的文本混淆技术仍将持续演化。攻击者可能尝试使用其他较少被关注的 Unicode 区间、组合多种混淆技术、或采用更复杂的字符插入策略来规避已有的规范化与检测机制。但无论具体手法如何变化,"匹配前先规范化" 这一基础原则具有长期价值 —— 它不针对某一种特定字符或某一种混淆模式,而是从根本上消除人类视觉与机器解析之间的不一致,使所有依赖不可见字符的混淆技术失效。

因此,文本规范化应当被视为所有内容安全产品的基础安全能力,而非针对特定攻击的临时补丁。产品设计时应当在所有内容处理管道的最上游建立统一的规范化层,覆盖完整的 Unicode 不可见与格式控制字符范围,并持续跟踪 Unicode 标准的更新与新出现的滥用模式。同时,规范化层的实现应当经过充分的测试,确保在剥离不可见字符时不影响正常文本的渲染与处理(如前述地区国旗 emoji 的例外处理)。

7 结论

ASCII 走私技术在钓鱼邮件规避中的大规模应用,是 2026 年初网络安全领域的一个重要事件。微软安全研究团队的监测与分析完整记录了这一活动的技术细节、时间线、规模与基础设施特征,为理解攻击技术跨域迁移的机制提供了宝贵的案例材料。该事件表明,Unicode 标签块这一原本因人工智能提示注入研究而受到关注的字符区间,已被传统钓鱼攻击者改造为关键词分隔工具,用于同时破坏基于规则的字面匹配与基于机器学习的分词分类,而邮件对人类收件人仍显示为完全正常的文本。

本文的分析表明,ASCII 走私技术能够形成检测盲区的核心前提是邮件安全管道在内容检测前未对 Unicode 标签块进行规范化处理。对于已实现完整规范化的产品,该技术无法干扰后续检测逻辑;同时,标签块字符在正常邮件中的极端稀有性使其本身可以作为高置信度的异常检测信号。多层防御架构的韧性在本次事件中得到验证 —— 超过 99% 的攻击邮件被不依赖 Unicode 特征的其他防护层拦截,这说明即使内容层存在潜在盲区,信誉层、行为层与基础设施层的检测仍能提供有效防护。

迪妙网络空间安全学院研究团队认为,ASCII 走私事件的更深远启示在于攻击技术跨域迁移的加速趋势。随着生成式人工智能工具在黑产中的普及,安全社区在一个领域中公开讨论的攻击手法会更快地被其他领域的攻击者吸收利用。防御方需要建立跨域的威胁监测视野,将人工智能安全、移动安全、云安全等相邻领域中涌现的新型规避技术纳入传统威胁检测的持续评估范围。同时,"匹配前先规范化" 应当被确立为所有内容安全产品的基础设计原则,文本规范化能力的完整性与覆盖范围应当成为产品安全评估的重要指标。

网络攻击与防御的博弈不会停止,ASCII 走私只是这一长期博弈中的一个阶段性手法。但通过对这一案例的深入分析,防御方可以提炼出具有普适性的经验:重视基础安全能力的建设、保持跨域的威胁视野、构建多层纵深的防御架构、以及在技术公开与风险防控之间寻求平衡。这些经验将有助于在未来面对未知的新型规避技术时,保持更主动的防御姿态。

编辑:芦笛(公共互联网反网络钓鱼工作组)

来源:迪妙网络空间安全学院

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档