首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >从序列模型到大语言模型:一次关于“注意力”的范式革命

从序列模型到大语言模型:一次关于“注意力”的范式革命

原创
作者头像
飞猫警长
发布于 2026-10-08 16:04:29
发布于 2026-10-08 16:04:29
200
举报

过去五年,AI领域经历了一场静默但彻底的底层重构。这场重构的起点,可以追溯到2017年一篇标题极为自信的论文——《Attention Is All You Need》。在此之前,序列建模被循环神经网络(RNN)及其变体主导了近二十年;在此之后,一种完全不同的计算范式——Transformer——几乎接管了所有与序列相关的任务,并最终催生了GPT系列、BERT以及今天我们所熟知的大语言模型(LLM)。

这篇文章试图沿着技术演进的脉络,梳理从RNN到Transformer再到LLM的关键转折点,并解释每一次转折背后的数学动机与工程约束。

一、序列建模的原始困境:RNN的梯度消失

序列数据的本质特征是顺序性——词语的顺序承载意义,时间步的先后决定因果。RNN的设计直觉非常直接:维护一个隐藏状态 htht​,在每个时间步读取当前输入 xtxt​ 并更新状态-1。

然而,这个看似优雅的设计在训练时暴露了一个根本性的数学困难。RNN通过时间反向传播(BPTT)计算梯度,梯度中包含循环权重矩阵 WhWh​ 的连续乘积 WhkWhk​。如果 WhWh​ 的主特征值小于1,梯度随步数 kk 指数衰减至零;如果大于1,则指数爆炸-47。这意味着原始RNN在实践中只能学习到跨越几个时间步的短期依赖,长距离关联在数学上就不可达-。

梯度爆炸可以通过梯度裁剪缓解,但梯度消失需要架构层面的根本性改变。

二、LSTM:门控机制与“梯度高速公路”

1997年,Hochreiter和Schmidhuber提出了长短期记忆网络(LSTM),用一个独立的细胞状态 ctct​ 作为记忆载体,并通过三个门控机制控制信息的写入、保留和输出-47。

遗忘门 ftft​ 决定保留多少旧记忆,输入门 itit​ 决定写入多少新信息,细胞状态的更新是加性的:

ct=ft⊙ct−1+it⊙c~tct​=ft​⊙ct−1​+it​⊙c~t​

这个加性更新是关键。当遗忘门接近1、输入门接近0时,细胞状态近似恒等传递,梯度可以沿这条“传送带”几乎无损地反向流动-。LSTM因此在实践中能够学习跨越数百甚至数千时间步的依赖。

但LSTM仍有两个无法回避的约束:序列计算无法并行——必须逐时间步推进;以及信息瓶颈——编码器需要将所有输入压缩为一个固定维度的上下文向量,长序列的信息在压缩中丢失-5。

三、Transformer:用注意力替代循环

2017年的Transformer架构做了两件激进的事:完全删除循环结构,并用自注意力作为唯一的序列混合机制-。

自注意力的核心公式是缩放点积注意力:

Attention(Q,K,V)=softmax(QKTdk)VAttention(Q,K,V)=softmax(dk​​QKT​)V

其中 QQ、KK、VV 均由同一输入序列通过不同的线性映射得到。缩放因子 dkdk​​ 防止点积在高维空间中过大导致softmax梯度消失。每个位置可以直接“看到”序列中的任意其他位置,路径长度为 O(1)O(1),彻底绕过了循环结构的长距离衰减问题-。

代价是:自注意力本身对序列顺序不敏感——矩阵乘法是无序的。Transformer通过正弦位置编码注入位置信息,将位置的正弦和余弦函数与词嵌入相加,使模型能够区分“狗咬人”和“人咬狗”-。

多头注意力进一步将 QQ、KK、VV 拆分为多个子空间,每个头独立计算注意力,最后拼接。这让模型能够同时关注不同类型的依赖关系——语法、语义、指代等-。

Transformer的关键工程优势是训练时的完全并行化:整个序列的注意力计算可以一次性在GPU上完成,训练速度相比RNN有数量级的提升-。

四、从Transformer到GPT:规模法则与上下文学习

GPT-1(2018)是Transformer解码器架构的第一次大规模预训练实践。它采用12层解码器、1.17亿参数,在BookCorpus上预训练,然后在下游任务上微调。核心贡献是验证了“预训练+微调”范式的可行性-23。

GPT-2(2019)将规模扩大到15亿参数,训练数据从7000本书扩展到800万网页。一个意外发现是:模型大到一定程度后,无需微调就能在部分任务上展现出零样本能力-23。

GPT-3(2020)将参数量推到1750亿,训练数据达到45TB。真正的质变发生在上下文学习:模型不需要梯度更新,仅凭提示词中的几个示例就能理解并执行新任务-23。这种能力的规模依赖性符合缩放法则——模型性能随参数量、数据量和计算量的增加呈幂律改善-。

五、对齐:从“会说话”到“说人话”

GPT-3虽然强大,但它只是一个“文本续写器”——你给它一个提示,它会生成统计上合理的续写,但不保证有用、无害或符合指令。ChatGPT的关键一步是基于人类反馈的强化学习(RLHF)-。

RLHF的流程分三个阶段:首先用人工标注的示例做监督微调;然后让人类对模型的多个输出进行偏好排序,训练一个奖励模型;最后用PPO等强化学习算法,以奖励模型的打分作为信号,优化语言模型的生成策略-。

这一步在技术上的意义是:把语言模型的优化目标从“下一个词的似然”转向“人类偏好的满足” 。似然目标关心的是“像不像人写的”,偏好目标关心的是“人觉得好不好”。

六、效率前沿:稀疏化与MoE

当模型规模进入千亿参数区间,稠密计算的成本变得难以承受。混合专家(MoE)架构提供了一条出路:将前馈网络拆分为多个“专家”,每个输入token只激活其中少数几个-。

DeepSeek-V3是这条路线上的一个代表性实践。它以671B总参数、37B激活参数的配置运行,通过细粒度专家分割和共享专家隔离两项设计,在保持计算预算的同时大幅扩展了模型容量-。同时,多头潜在注意力(MLA)通过对KV缓存进行低秩压缩,显著降低了推理时的显存占用。

结语

从RNN到Transformer,从GPT到RLHF再到MoE,这条演进线的底层逻辑是一致的:每一次架构变革,都是在“表达能力”和“计算可行性”之间寻找新的平衡点。RNN受限于梯度消失,LSTM用门控缓解但无法并行,Transformer用注意力换取并行与全局依赖,GPT系列用规模法则验证了“更大即更强”,RLHF让强大变得可用,MoE让可用变得可负担。

这条路上没有“终极答案”,只有不断重新谈判的权衡。而下一代架构——状态空间模型、线性注意力、混合专家与循环结构的融合——正在这条线上继续向前。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、序列建模的原始困境:RNN的梯度消失
  • 二、LSTM:门控机制与“梯度高速公路”
  • 三、Transformer:用注意力替代循环
  • 四、从Transformer到GPT:规模法则与上下文学习
  • 五、对齐:从“会说话”到“说人话”
  • 六、效率前沿:稀疏化与MoE
  • 结语
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档