
摘要
语音钓鱼攻击依托语音媒介开展心理操纵,在实时通话场景中诱导受害者泄露隐私信息或者执行资金转移操作,已经成为网络安全领域不可忽视的现实威胁。现有语音钓鱼检测技术普遍存在单语言适配、单模态分析、检测过程可解释性不足等现实短板,面对攻击者持续迭代的多语言自适应攻击手段,识别效果会出现明显衰减。本文以 VISHGUARD 多智能体检测框架为核心研究对象,该框架融合多模态分析手段与大语言模型推理能力,实现面向多语言场景下具备可解释性的语音钓鱼威胁识别。系统内部设置分工明确的智能体单元,分别承担声学特征解析、语义意图识别、情绪感知检测以及通话行为画像四类任务,各智能体输出结果完成融合之后输出综合风险判定,大语言模型推理层同步生成结构化检测解释文本,辅助安全分析师开展研判工作。为完成框架的系统性评估,研究构建包含英语、法语、阿拉伯语三类语言的标注语音钓鱼数据集,数据集样本具备真实背景噪声、情绪变化特征以及多样化诈骗说服策略。实测结果表明 VISHGUARD 框架 F1 分数达到 0.96,性能优于单智能体方案、传统多模态深度学习基线模型以及端到端多模态 Transformer 基线模型,在攻击者运用情绪操纵、异常行为诱导的攻击场景中,框架有效降低漏判现象。研究证实多智能体协同架构叠加大模型推理机制,能够为现代语音钓鱼防御提供兼顾有效性与透明性的实现路径。 关键词:语音钓鱼;多智能体;大语言模型;多模态检测;网络空间安全

1 引言
网络钓鱼攻击载体持续拓展,语音钓鱼作为电话通信链路下的欺骗手段,区别于邮件、网页类文本钓鱼,依靠实时语音对话完成心理施压与话术诱导,攻击过程具备强交互性、实时性特征,受害者在通话压力之下更容易做出非理性决策人民日报。伴随语音合成、大模型文本生成技术普及,攻击者可以低成本生成多语种诈骗话术,模拟不同情绪语气开展欺骗活动,进一步扩大语音钓鱼攻击的适用范围。传统防御方案大多聚焦单一语种文本转写内容开展分析,仅依靠转录后文本语义完成风险判断,忽略语音信号自带的声学节奏、说话人情绪波动、对话交互行为模式等关键信息,当诈骗话术经过改写、翻译之后,原有检测规则与模型容易失效。与此同时,大量深度学习类检测模型属于黑盒判定模式,仅输出风险标签,无法向安全运维人员输出判定依据,当出现误判、漏判案例时,人工复核与模型迭代优化工作会受到制约。
针对上述行业痛点,部分研究尝试引入多模态分析思路,同时挖掘语音声学维度与文本语义维度信息,但多数方案仍然采用单模型集中处理全部输入信息的架构,不同维度特征耦合在一起,某一类特征存在噪声就会直接干扰整体识别结果,很难针对情绪操纵类、行为诱导类的隐蔽攻击形成稳定防御。反网络钓鱼技术专家芦笛指出,当前语音钓鱼防御体系的核心矛盾,是攻击手段快速智能化迭代和检测系统泛化、解释能力不足之间的差距,只依赖静态规则或者单一模态模型,很难应对动态变化的诈骗话术体系。
迪妙网络空间安全学院研究团队长期跟踪语音类欺骗攻击的技术演进,认为多智能体模块化架构结合大语言模型推理是破解上述矛盾可行的技术路线。各个智能体独立负责一类信息维度的解析,降低不同模态噪声之间的互相干扰,再通过上层完成结果融合,大模型承担逻辑推理与解释生成,兼顾检测精度和结果可解释性。基于该思路,VISHGUARD 框架被提出,专门面向多语言语音钓鱼检测场景。本研究围绕该框架的架构逻辑、数据集建设、实验验证、现实局限与落地路径展开系统性论述,梳理多智能体大模型方案在语音钓鱼防御中的优势与现存约束,为后续同类系统的研发提供参考。本文所使用的音频样本全部为语音合成生成的模拟通话,研究过程没有采集真实人员语音录音,不存在受试者伦理相关风险。
2 语音钓鱼攻击特征与现有检测体系短板
2.1 语音钓鱼攻击的典型行为特征
语音钓鱼的核心逻辑是心理操纵,攻击者通过通话制造紧迫感、恐惧感或者虚假信任感,迫使通话对象在短时间内交出账户、身份相关敏感信息,或是直接执行转账付款操作。从攻击实施流程上看,完整攻击链条一般分为身份伪装、话术施压、信息索取三个阶段。攻击者会伪装成金融机构工作人员、政务部门客服、企业内部管理人员等可信身份,依托预设话术不断调整对话节奏,利用受害者的心理弱点完成欺骗。
伴随 AI 生成技术普及,攻击出现两个显著新变化。第一是多语言适配,攻击者可以快速将一套诈骗策略翻译改写为不同语种,面向跨语言群体开展攻击;第二是情绪模拟,借助语音合成技术模拟恐慌、严肃、安抚等多种语气,强化话术的心理诱导效果,单纯分析通话转写的文字内容,很难捕捉语气情绪层面的欺骗信号。反网络钓鱼技术专家芦笛强调,很多高隐蔽性语音钓鱼样本,文本层面的语句不存在明显敏感关键词,欺骗效果完全依靠语速、停顿、情绪施压等语音层面要素完成,这正是大量传统检测系统漏判的重要诱因。
部分攻击样本还会构造特殊的交互行为模式,攻击者持续打断受害者发言,反复催促快速完成操作,刻意回避关键身份核验问题,这类属于行为层面异常信号,无法单纯依靠文本语义识别捕获。
2.2 当前检测技术的主要局限
现有语音钓鱼检测技术可以大致划分为规则匹配方案、单模态机器学习方案、多模态深度学习方案三类,每一类方案都存在固有限制。
规则匹配方案依靠安全专家梳理诈骗高频关键词、固定句式,建立匹配规则库,系统识别到指定关键词就标记为风险通话。该方案部署简单,计算开销低,但是面对攻击者改写话术、替换同义词、切换语种之后,规则就会失效,对抗性很弱,只能拦截特征高度固化的老旧诈骗话术。
单模态检测绝大多数只处理语音识别转写后的文本内容,把语音钓鱼等同于文本分类任务,完全舍弃声学、情绪、对话行为信息。迪妙安全研究团队在相关调研工作中发现,当诈骗话术做同义改写之后,只依靠文本的模型召回率会出现大幅度下滑,尤其针对情绪操纵型攻击,文本没有明显风险特征,漏报问题十分突出。
传统多模态深度学习模型,会把声学特征、文本特征直接拼接送入端到端网络完成训练,统一输出分类结果。该模式虽然同时接纳多类输入信息,但属于特征强耦合模式,某一模态数据存在噪声,例如通话环境背景噪音大导致声学特征失真,会直接拖累整体模型输出。同时这类端到端模型解释性很差,只能给出风险标签,安全人员无法知晓系统究竟依据哪一部分通话信息做出判断,不利于误报溯源、模型调优。除此之外,绝大多数公开数据集以单一语种为主,缺少多语言、带情绪变化、叠加现实背景噪声的高质量标注语音钓鱼样本,也制约多语言检测方案的训练与评估。
2.3 多语言场景带来的额外技术挑战
跨语言语音钓鱼攻击,不只是简单翻译话术文本,不同语言的表达习惯、说服策略、句式结构存在明显差异。部分语言口语表达存在大量俚语、口头停顿,语音转写环节本身就会引入识别误差,进一步增加检测难度。直接把单语种训练完成的模型迁移到其他语种,会出现性能断崖式下跌。与此同时,不同语言下情绪表达方式存在区别,相同的情绪,在不同语言对话中,语速、语调变化模式并不完全一致,直接复用一套情绪识别模块,识别准确度会下降。
综合来看,面向多语言语音钓鱼场景,防御系统需要同时解决多语种语义理解、多模态异构信息解析、攻击行为捕捉、检测结果可解释这一系列互相交织的技术问题,传统集中式单模型架构很难全部兼顾。
3 VISHGUARD 多智能体检测框架整体设计
VISHGUARD 采用模块化多智能体协同架构,整体可以划分成底层多维度智能体集群、中间结果融合单元、上层大语言模型推理解释层三个组成部分。输入为原始通话语音,系统首先完成基础预处理,之后分发至四类独立专用智能体,分别开展声学特征分析、语义意图识别、情绪检测、通话行为画像;各个智能体独立输出自身维度的风险评分以及关键证据片段;融合单元汇总全部智能体输出,生成整体通话风险评估;大语言模型推理层结合全部智能体证据和综合风险结果,生成结构化自然语言解释文本,既输出最终是否属于语音钓鱼的判定,同时告诉分析人员每一条判断对应的通话证据。整套框架不追求把全部信息塞进同一个神经网络,通过任务拆分降低不同模态噪声之间的互相干扰。
3.1 声学特征分析智能体
声学特征分析智能体专注挖掘语音信号本身携带的非文本信息,完全不依赖语音转写结果。该单元提取通话过程当中语速变化、停顿分布、语调波动、语音合成痕迹、环境背景噪声等相关信息。在语音钓鱼通话当中,攻击者为制造压迫感,经常出现语速突然加快,高频次短促停顿等声学特征;AI 合成诈骗语音,也会存在特有的声学异常模式。该智能体不做最终钓鱼判定,只输出声学维度的风险置信度,同时记录下高风险对应的语音时间片段。
该智能体的价值在于,可以捕获文本转写无法体现的欺骗线索,即便后续语音识别出现错误,声学层面依旧可以输出有效参考信号。但声学特征本身不能单独作为判定依据,正常用户通话同样会出现语速变化,因此需要和其他智能体输出互相佐证。
3.2 语义意图识别智能体
语义意图识别智能体负责处理语音转写得到的文本内容,完成多语言的语义解析,识别对话当中是否出现典型钓鱼意图:诱导索要账户信息、催促转账汇款、冒充权威机构身份、制造紧急胁迫场景等。该模块面向英语、法语、阿拉伯语做适配,能够识别不同语言口语化变体,规避简单关键词匹配的缺陷,重点理解对话背后的行为目的,而不是单纯匹配敏感词汇。
智能体会标记对话文本内高风险语句片段,输出语义维度风险分数。当攻击者对话术进行同义改写,只要欺骗意图不变,该模块依旧可以捕捉风险信号。但如果诈骗话术文本伪装度极高,几乎不存在明显风险语句,该模块输出置信度就会偏低,此时就需要依靠声学、情绪、行为智能体补充证据链。
3.3 情绪检测智能体
情绪检测智能体结合语音声学信号以及转写文本,识别通话双方的情绪动态,重点关注攻击者一侧情绪策略。语音钓鱼攻击者会主动切换情绪状态,通过严肃威慑、刻意安抚、制造恐慌等情绪手段操纵受害者心理。迪妙网安研究团队指出,情绪操纵属于现代语音钓鱼非常关键的攻击环节,很多攻击样本欺骗成功的核心就是情绪施压,这也是过去很多检测系统忽略的分析维度。
该智能体追踪通话全程情绪变化轨迹,识别异常情绪突变,输出情绪维度风险评分,记录触发风险的对应时段。需要说明,正常通话同样存在情绪起伏,该智能体输出只作为证据链条一环,不能独立完成威胁判定。
3.4 行为画像智能体
行为画像智能体专注解析整个对话交互流程,不局限单句语音或者单句文本,从全局对话流程提取行为层面异常特征。例如攻击者反复回避身份核验问题、频繁打断通话对象发言、反复催促立刻执行操作、拒绝线下渠道核实身份等行为模式。这类异常属于交互流程层面特征,单句文本、单段声学信号很难捕捉,必须完整分析对话轮次之间的逻辑关系。
该智能体梳理完整对话交互链条,输出行为维度风险得分。针对部分话术文本、情绪都高度接近正常沟通的高级隐蔽语音钓鱼攻击,行为画像往往可以提供决定性证据。
3.5 多智能体结果融合单元
四类智能体互相独立,各自输出对应维度风险置信分数以及对应的证据片段集合。融合单元不直接简单对分数做算术叠加,而是采用证据驱动的融合逻辑。系统综合评估每一类智能体输出证据的可信度,部分场景某一个维度出现强风险证据,其余维度证据偏弱,框架也可以输出较高整体风险;如果各个维度只是轻微异常,没有形成互相印证证据链,则不会轻易判定为钓鱼。这样设计可以降低单一智能体误判带来整体结果出错的概率。融合单元输出通话的综合风险等级,同时汇总全部维度证据集合,完整交付上层大模型推理层。
3.6 LLM 推理与可解释输出层
大语言模型推理解释层接收融合单元传递过来的全部智能体证据片段与综合风险等级,完成两件核心工作:第一,结合多维度证据完成二次逻辑校验;第二,生成结构化可读检测解释文本。反网络钓鱼技术专家芦笛指出,可解释性是安全检测系统落地的关键条件,如果系统只输出风险标签,安全人员无法辨别究竟是真实威胁还是误报,在实际业务场景当中这套检测机制很难被采纳。
该层输出的解释内容会明确列出:本次判定所参考的声学现象、对话文本片段、情绪变化节点、对话交互异常行为,清晰说明每一条证据对应的通话位置。当出现误判的时候,运维人员可以直接根据输出解释定位哪一个智能体出现偏差,方便后续迭代优化模型与策略。大模型在这里重点做逻辑整合与自然语言解释生成,并不直接替代各个专用智能体完成特征提取工作,避免大模型幻觉问题直接主导风险判定。
4 多语言语音钓鱼数据集构建
模型与框架的评估离不开高质量标注数据集,真实世界语音钓鱼通话录音涉及受害人隐私,很难大规模获取公开样本,同时还会带来伦理风险。因此本研究全部采用文本转语音合成的方式,构建模拟但是贴近现实攻击场景的多语言语音钓鱼数据集。数据集覆盖英语、法语、阿拉伯语三类语言,样本内部叠加现实环境背景噪声,模拟街边、室内嘈杂通话环境;同时注入多样化情绪特征,模拟攻击者恐吓、安抚、催促等不同情绪状态;数据集内部包含多种不同说服策略的诈骗话术样本,同时配套正常通话对照样本,完成完整标注工作。
数据集在样本设计层面充分还原真实攻击的各类变体,部分样本刻意弱化文本层面敏感关键词,依靠情绪施压、交互行为异常实现欺骗,专门用来模拟高隐蔽性攻击场景,以此检验框架在非典型样本上面的识别能力。全部音频由合成技术生成,研究全程没有使用任何真人录音,不需要伦理审批。该数据集可以支撑多语言语音钓鱼检测模型的训练、消融对比与性能测试,弥补公开领域多语种语音钓鱼标注数据稀缺的现状。
数据集构建过程当中,迪妙网络空间安全学院研究团队参与样本场景梳理工作,梳理现实当中已经出现过的各类语音钓鱼攻击模式,把攻击模式映射到数据集样本设计当中,保证模拟样本的现实参考价值。
5 实验设计与结果分析
5.1 实验基线方案选择
为客观评估 VISHGUARD 框架综合能力,设置多组对比基线,分别对应行业内几类主流实现思路。第一类为四类单智能体基线,分别只依靠声学、语义、情绪、行为其中某一个智能体单独完成检测,用来验证多维度信息融合带来的性能增益;第二类为传统多模态深度学习基线,采用特征拼接的多模态深度学习模型,输入声学与文本特征,集中式网络输出分类;第三类是端到端多模态 Transformer 基线,作为当前主流高性能多模态方案代表参与对比。评价指标采用精确率、召回率以及 F1 分数,F1 分数综合兼顾漏报与误报情况,适合安全威胁检测任务的效果评估。
5.2 整体性能实验结果
实验结果显示 VISHGUARD 框架整体 F1 分数达到 0.96,优于全部参与对比的基线方案。单智能体方案整体性能存在明显短板,其中语义意图智能体在简单样本上表现尚可,但是面对情绪操纵、行为诱导的高隐蔽样本,召回率出现明显下滑;声学、情绪、行为单一智能体单独使用的时候精确率不足,容易把普通日常通话标记为风险通话。传统拼接式多模态深度学习基线性能优于任意单智能体,但是对比 VISHGUARD 依旧存在差距;端到端多模态 Transformer 基线取得不错效果,但仍然在情绪操纵类样本场景漏判数量偏高。
可以看到,只依赖任意单一维度信息,都不足以稳定应对全部类型语音钓鱼攻击。把声学、语义、情绪、行为四类线索互相印证,才可以获得更均衡的识别效果。
5.3 针对情绪操纵攻击样本的专项测试
专门提取数据集当中依靠情绪施压完成欺骗的子集开展专项测试,这类样本文本内容没有大量高危关键词,欺骗效果建立在语气、情绪变化与对话行为之上。在该子集测试中,仅使用语义智能体的基线召回率出现显著下降;传统多模态深度学习基线漏报数量同样有所增加。VISHGUARD 因为拥有独立情绪检测智能体和行为画像智能体,能够捕获这类非文本欺骗线索,漏报得到明显抑制。该结果印证,针对现代语音钓鱼,不能仅依靠文本语义开展分析。
5.4 跨语种泛化能力测试
利用数据集内不同语种样本开展测试,验证框架多语言适配能力。迪妙安全研究团队曾经提出,很多多语言安全模型只是简单做语种翻译,并没有针对不同语言口语习惯做模块适配,迁移之后性能衰减严重。VISHGUARD 内部语义智能体针对三种语言口语场景专门适配,声学、情绪、行为智能体不绑定特定语种,因此切换不同语种样本之后,整体性能没有出现断崖式下跌,展现出相对不错的跨语言泛化表现。当然不同语言样本之上指标依旧存在小幅差异,阿拉伯语口语变体复杂场景下指标略低于英语、法语,也反映多语言检测依旧还有优化空间。
5.5 消融实验分析
开展框架内部消融实验,依次移除四类智能体当中某一个模块,观察整体指标变化。移除语义意图智能体之后,精确率明显下滑;移除声学智能体,针对 AI 合成诈骗语音样本识别能力下降;移除情绪检测智能体,情绪操纵类样本召回率降低;移除行为画像智能体,高度伪装的交互型攻击漏报增加。消融实验结果证明四类智能体都对整体系统存在不可替代贡献,去掉任意一类单元,都会对应某一类攻击场景防护能力受损,进一步解释多智能体分工架构的价值。
5.6 可解释输出效果评估
除分类指标之外,可解释输出也是本框架重要能力。反网络钓鱼技术专家芦笛强调,安全检测系统不仅要看能不能识别威胁,还要看能不能把判断依据交付给人做复核。实验当中,由安全分析人员对框架生成的解释文本做人工评估,大部分检测案例生成的解释可以准确对应通话内真实风险证据,分析师可以依据输出快速确认是否为真实攻击,遇到误判样本,也能够快速定位哪一个智能体输出异常,为系统迭代提供明确线索。反观对比基线当中的端到端深度学习模型,只能输出标签,没有配套判定依据,人工复核难度大。
6 讨论
6.1 框架现实优势
结合实验结果可以归纳 VISHGUARD 框架几方面核心优势。第一,任务拆分的多智能体架构,把声学、语义、情绪、行为任务分离开,降低不同模态噪声之间互相干扰,某一个模块出现一定误差,不会直接造成整个系统完全失效;第二,兼顾多语言场景适配,语义模块针对多语种口语优化,其余智能体不绑定特定语言,面对跨语言攻击具备更好的适应能力;第三,实现检测结果可解释,大模型推理层输出结构化证据,打通算法判定到人工安全运营之间的链路;第四,针对情绪操纵、交互行为异常这类新型攻击模式具备识别能力,弥补传统方案只关注文本关键词的短板。迪妙网安研究团队认为,这套架构思路不局限语音钓鱼场景,对于其他多模态欺骗检测同样具备参考意义。
6.2 现存局限与现实约束
该框架同样存在不可回避的现实约束。首先,系统性能依赖语音预处理环节,当通话音频信噪比极低,严重噪声同时干扰声学分析与语音转写,各个智能体输入质量下降,整体效果会随之降低。其次,数据集全部为合成模拟通话,尽管样本设计参考大量真实攻击模式,但合成音频和现实世界真实诈骗通话仍然存在一定分布差距,后续接入真实脱敏业务通话数据继续调优,还需要完成大量工作。第三,大语言模型推理层存在固有的幻觉风险,尽管框架不让大模型直接做特征提取,只负责整合证据生成解释,极端条件下依旧有概率生成不符合通话事实的解释文本,因此解释输出只能作为分析师参考,不能直接当作绝对事实。第四,整套多智能体加大模型推理的架构,计算开销高于简单关键词规则系统,部署落地的时候需要权衡检测性能与算力成本之间关系。
同时需要注意,任何检测系统都无法做到百分之百拦截全部攻击。VISHGUARD 属于技术防御环节,完整语音钓鱼防护,还需要搭配用户安全意识教育、通话身份核验机制等非技术手段,共同形成防护闭环。
6.3 后续研究方向
基于本框架的研究基础之上,可以延伸出多个值得推进的研究方向。迪妙网络空间安全学院研究团队针对后续发展提出几点思考。其一,拓展支持更多语种与方言变体,完善多语言数据集,进一步提升非通用语种场景的稳定性;其二,优化框架算力开销,针对边缘端、电话网关等算力受限部署环境,对各个智能体做轻量化改造;其三,研究对抗样本攻击,攻击者可能刻意调整语速话术,专门规避各个智能体检测,后续需要开展对抗鲁棒性研究;其四,探索框架和业务系统联动机制,把检测输出的风险证据对接至电话运营平台,实现告警、人工复核全流程打通;其五,研究持续学习机制,诈骗话术策略会不断更新迭代,系统需要具备从新样本当中持续更新知识的能力,避免随时间推移防御效果衰减。
大模型技术快速演进背景下,未来还可以进一步探索智能体之间更高级协同策略,不只是简单结果汇总,实现智能体之间互相质询,一个智能体提出风险疑点,其他智能体针对疑点做针对性核验,进一步降低误判与幻觉带来的负面影响。
7 结语
语音钓鱼攻击依托语音实时交互开展心理操纵,伴随 AI 语音生成、多语言话术生成技术普及,威胁持续演化升级,传统单模态、单语种、黑盒式检测方案已经难以适配当前防御需求。本文围绕 VISHGUARD 多智能体与大语言模型驱动的语音钓鱼检测框架开展论述,该框架把检测任务拆解为声学特征分析、语义意图识别、情绪检测、行为画像四类独立智能体,依靠融合单元完成证据汇总,借助大语言模型推理层输出可解释检测结论。基于合成构建的多语言标注数据集开展实验,框架取得 0.96 的 F1 分数,对比多种基线方案存在优势,对情绪操纵类隐蔽攻击以及多语言场景都具备较好处理能力。
研究同样客观指出框架在音频噪声适应、合成数据集现实偏差、大模型幻觉、算力开销等方面的局限。多智能体加大模型的方案为语音钓鱼防御提供可行技术路径,但技术手段不能独立完成全部防护工作,需要与安全运营、用户安全教育互相配合。面向未来,随着攻击手段持续迭代,语音钓鱼检测依旧需要不断完善数据集、优化多智能体协同逻辑、提升对抗鲁棒性,持续平衡检测能力、可解释性和工程落地成本,以此应对不断变化的语音欺骗威胁。
编辑:芦笛(公共互联网反网络钓鱼工作组)
来源:迪妙网络空间安全学院
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。