欢迎光临
我们一直在努力

老码农和你一起学AI系列:LSTM和Transformer的比较

今天就LSTM和Transformer的比较。这不仅是Transformer最革命性的突破,也是你理解当代AI为何能如此强大的关键一环。

想象一下,你要总结一场100人的视频会议(相当于一个由100个词组成的句子)。

  • RNN/LSTM的方式:你必须一个接一个地单独谈话,听完第1个人才能找第2个人,全部听完需要100个时间单位。而且,聊到最后一个人时,你对第一个人的印象已经模糊了。

  • Transformer的方式:你把所有人拉到一个群里,说:“现在,每个人告诉我,你觉得谁最重要,并说明理由。”然后,所有人同时开始思考和回复。所有信息在1个时间单位内就能全部汇总完毕。

这就是“顺序处理”与“全局并行”的直观差距。下面我深入技术层面,看看Transformer是如何实现这种降维打击的。

一、RNN/LSTM的局限

RNN/LSTM的架构决定了它必须一步一步走,无法跳跃。

它们的核心是隐藏状态h\\boldsymbol{\\displaystyle y}​。这个状态的更新公式可以简化为:

                       ht​=f(ht−1​,xt​)

要计算 ℎ5,必须先知道 ℎ4;要计算 ℎ4​,又必须先知道 ℎ3。

这就像一条单向通行的链条,每一个环节都依赖于前一个环节的结果。这种时序依赖是RNN/LSTM的“原罪”,它强行将计算过程变成串行,无法利用现代GPU的大规模并行计算能力。

二、Transformer如何处理串行枷锁

Transformer做了一件极其简单又极其大胆的事:我不等了!我不要这个逐步传递的隐藏状态了!

它采用了一种全新的策略:全同时、直接对话。这就是自注意力机制的核心理念。

它的并行计算主要通过两个层面的设计实现:

全局视野——矩阵运算代替循环

Transformer抛弃了逐步递进的隐藏状态。在处理一个句子时,它一次性接收所有词的初始表示(词嵌入+位置编码)。然后,它通过一个巨大的矩阵运算,让所有词同时计算出它们两两之间的关联度(注意力分数)。

这个过程不再是“A->B->C”的链条,而是“A、B、C同时互评”。在数学上,这对应着巨大的矩阵乘法,而矩阵乘法恰恰是GPU最擅长并行计算的领域。

多头机制——同时处理多种关系

这就像刚才那个“百人会议”的升级版。你不仅让所有人同时发言,还给他们分了不同的讨论小组:

  • 语法组:同时讨论句子结构和词性。

  • 语义组:同时讨论实体关系和指代。

  • 情感组:同时讨论情感色彩。

这些小组(即“多头”)的计算也是完全并行的。它们互不干扰,同时从不同角度分析句子,最后把分析结果汇总在一起。这进一步压榨了并行计算的能力,让模型在同一时间内完成了更多维度的信息抽取。

并行下如何理解顺序?

你可能会问:既然所有词都是同时处理的,那Transformer如何知道哪个词在前、哪个词在后?毕竟语言顺序很重要,“猫追老鼠”和“老鼠追猫”完全不同。

这就要提到Transformer另一个精妙的设计:位置编码。

它是在把词向量输入模型时,强行给每个词加上一个代表其位置的“身份标识”。这个标识可以是基于正弦余弦函数的固定模式,也可以是可学习的向量。

通过这种方式,Transformer虽然在计算上是并行的,但每个词的输入里都带上了“我是第几个词”的标签。这样,模型在进行全局注意力计算时,就能区分出“猫”在“老鼠”前面,还是“老鼠”在“猫”前面。

最后小结

可以用一张表格来直观感受Transformer对RNN/LSTM的颠覆:

维度RNN / LSTMTransformer革命性突破
计算方式 串行:逐步计算,t时刻依赖t-1时刻 并行:一次性计算所有词之间的关系 训练时间从周缩短到天甚至小时
视野范围 有局限:越远的信息越模糊(遗忘问题) 全局:无论距离远近,都能直接建立联系 解决了长期依赖的痛点
信息处理 单一通道:只有一个隐藏状态传递信息 多维空间:多头机制提供多个视角 能够同时捕捉语法、语义等多种关系
速度瓶颈 无法突破:GPU算力被闲置 充分利用:核心计算是高效的矩阵乘法 为大模型的规模扩展铺平了道路

Transformer的“全局并行”并非某种神奇的魔法,而是一种“空间换时间”的架构革命。它放弃了RNN那种精巧的、渐进式的信息传递链条,转而用极其“暴力”的方式——让所有元素在同一时刻进行全排列组合式的信息交互,然后通过海量的算力和精巧的数学设计,从中筛选出真正有价值的信息。正是这种“暴力”但高效的并行能力,使得训练拥有数千亿参数的GPT-4、Llama 3这样的巨型模型成为可能,也让我们今天能在这里畅谈AI的未来。

赞(0)
未经允许不得转载:171主机测评 » 老码农和你一起学AI系列:LSTM和Transformer的比较
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址