Gated Attention报告 - 演讲稿

📢 使用说明

  • 这是完整的演讲稿,包含每一页PPT要说的话
  • 标注了重点强调的地方
  • 包含停顿和互动的提示
  • 预计时长:28-32分钟

第一部分:开场(3分钟)

Slide 1: 标题页

大家好!今天我要给大家介绍一篇关于改进Transformer Attention机制的论文,标题是《Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free》。

这篇论文提出了一个非常简单但有效的改进方法,只需要加一行代码,就能显著提升模型性能。

Slide 2: 目录

今天的报告分为六个部分:

首先,我会简单回顾Transformer和Attention机制的背景知识。

然后,重点分析原始Attention的三大缺陷,特别是低秩瓶颈问题。

接着,介绍论文提出的门控机制。

第四部分是今天的重点:深入分析门控机制带来的非线性增益,这也是老师要求的核心内容。

第五部分展示实验结果。

最后是总结与展望。

Slide 3: 为什么研究这个问题?

为什么要研究Attention的改进呢?

首先,现代的大语言模型,比如GPT系列、BERT、LLaMA等,都是基于Transformer架构的。

而Attention机制是Transformer的核心。但是,原始的Attention机制存在一些固有的缺陷。

这篇论文提出了一个简单但有效的改进:只需要加一行代码,就能让PPL提升4.4%。

这个改进不仅简单,而且有深刻的理论基础,这也是我今天要重点讲解的内容。


第二部分:背景知识(4分钟)

Slide 4: Transformer架构回顾

在深入论文之前,我们先快速回顾一下Transformer的架构。

【指向图】Transformer由Encoder和Decoder组成,核心组件包括Multi-Head Attention、Feed-Forward Network、Layer Normalization和Residual Connection。

今天我们主要关注Multi-Head Attention这个部分。

Slide 5: Self-Attention机制

Self-Attention的核心公式是这样的:

【指向公式】Attention(Q, K, V) = Softmax(QK^T/√d) · V

计算过程分为四步:

第一步,计算Query和Key的相似度,也就是Q·K

第二步,除以√d进行缩放,防止数值过大。

第三步,用Softmax归一化,得到注意力权重。

第四步,用这些权重对Value进行加权求和。

【停顿】这个过程大家应该都比较熟悉了。

Slide 6: 多头注意力

多头注意力的公式是:MultiHead = Concat(head₁,…,headₕ) · Wₒ

简单来说,就是并行运行多个Attention head,比如8个,每个head学习不同的关系模式,最后把它们拼接起来,再通过一个输出投影矩阵Wₒ。

【强调】这个输出投影矩阵Wₒ,在后面分析低秩瓶颈时会非常重要。


第三部分:原始Attention的三大缺陷(7分钟)⭐

Slide 7: 缺陷概览

好,现在进入今天的第一个重点:原始Attention的三大缺陷。

【指向列表】这三大缺陷分别是:

第一,低秩瓶颈,也叫线性瓶颈,导致表达能力受限。

第二,Attention Sink,第一个token的注意力权重异常高。

第三,缺乏稀疏性,无法真正”关闭”某些head。

接下来我会逐一详细讲解。

Slide 8: 缺陷1 - 低秩瓶颈(上)

首先是低秩瓶颈。要理解这个问题,我们先要知道什么是线性变换。

【指向公式】线性变换就是f(x) = W·x,用一个矩阵乘以一个向量。

线性变换有两个重要特性:齐次性和可加性。

【类比】可以把线性变换想象成一个”变形器”,只能做拉伸、压缩、旋转、翻转这些操作。

Slide 9: 缺陷1 - 低秩瓶颈(下)

现在是关键问题:两个线性变换的组合还是线性的!

【指向证明】我们来证明一下:

假设h(x) = W₂·(W₁·x),根据矩阵乘法的结合律,这等于(W₂·W₁)·x,我们可以把它写成W₃·x。

所以,两个线性变换的组合,还是一个线性变换。

【强调】在Attention中,这意味着什么呢?

【指向公式】Attention的输出是o = (A·V)·Wₒ,这可以改写成A·(V·Wₒ) = A·V’。

这说明输出投影矩阵Wₒ的作用非常有限!它只是把V变换了一下,但没有增加表达能力。

从数学上讲,rank(o) ≤ rank(V),Wₒ无法增加V的秩。

【类比】就像一张2维的纸,无论你怎么折叠、旋转,它还是2维的,无法变成3维的立体。

【停顿,确认理解】这个问题大家理解了吗?

Slide 10: 缺陷2 - Attention Sink

第二个缺陷是Attention Sink,也就是注意力陷阱。

【指向数据】实验发现,在长文本生成时,第一个token的平均注意力权重高达46.7%!

正常情况下,如果有100个token,每个token应该得到大约1%的权重。但第一个token却得到了将近一半的权重,这显然不正常。

【指向热力图】从这个热力图可以看到,第一列(第一个token)异常红,说明权重很高。

为什么会这样呢?

原因是Softmax强制要把权重分配给所有token。当某个位置不需要关注任何信息时,Softmax还是要分配权重,于是第一个token就成了”垃圾桶”,模型把不需要的注意力都扔给它。

【类比】就像做选择题,必须选一个答案,即使所有选项都不对,你也只能随便选一个。

Slide 11: 缺陷3 - 缺乏稀疏性

第三个缺陷是缺乏稀疏性。

【指向公式】Softmax的公式是这样的,关键是:exp函数恒正,所以Softmax的输出都大于0。

【指向例子】看这个例子:即使输入是-100(非常小的数),Softmax的输出也不是0,而是一个很小的正数。

这意味着什么?

意味着即使某个token完全无关,Softmax也会给它一个小权重。所有token的信息都会被混合进来,无法真正”忽略”。

同样,所有的head都在工作,无法真正”关闭”某些不需要的head,这就浪费了计算资源。

Slide 12: 三大缺陷总结

【指向表格】我们来总结一下这三大缺陷:

低秩瓶颈,原因是线性变换的组合还是线性,后果是表达能力受限。

Attention Sink,原因是Softmax强制分配权重,后果是信息失真。

缺乏稀疏性,原因是Softmax恒正,后果是计算浪费。

【强调】这三个问题的核心都在于:线性和Softmax的约束。


第四部分:门控机制(5分钟)

Slide 13: 核心思想

那么,论文是怎么解决这些问题的呢?

答案非常简单:加一个sigmoid门控!

【指向公式对比】看这两个公式:上面是原始Attention,下面是门控Attention。

唯一的区别就是在Attention输出后,乘以一个sigmoid(g)。

【强调】就这么简单!只加了一行代码!

Slide 14: 实现细节

具体来说,门控参数g是怎么设计的呢?

【指向说明】每个head有一个标量参数g。如果有8个head,就有8个g。这些g是可学习的,通过反向传播更新。

【指向Sigmoid曲线】Sigmoid函数把g映射到(0,1)区间:

  • 当g很大时,sigmoid接近1,门打开
  • 当g很小时,sigmoid接近0,门关闭
  • g=0时,sigmoid=0.5,半开

【类比】就像一个音量旋钮,可以从0(静音)调到1(最大音量)。

Slide 15: 为什么有效?

为什么这么简单的改动能同时解决三大问题呢?

【指向列表】

第一,sigmoid是非线性函数,引入了非线性,打破了低秩瓶颈。

第二,当不需要关注时,可以把sigmoid调到接近0,不再需要把注意力扔给第一个token,消除了Attention Sink。

第三,sigmoid可以接近0,实现了真正的稀疏性,自动关闭不需要的head。

【强调】一石三鸟!

Slide 16: 门控分数分布

那么,训练后的门控分数是什么样的呢?

【指向柱状图】这是统计结果:

25%的head的门控分数在0.0-0.2之间,基本关闭。

45%的head的门控分数在0.8-1.0之间,基本打开。

这说明什么?

说明模型自动学会了哪些head有用(打开),哪些head没用(关闭)。不需要人工设计,模型自己就实现了稀疏化!


第五部分:非线性增益分析(8分钟)⭐⭐ 重点

Slide 17: 什么是非线性?

好,现在进入今天的核心重点:非线性增益分析。

首先,我们要搞清楚什么是非线性。

【指向定义】线性函数满足f(ax) = a·f(x),非线性函数不满足。

【指向例子】看这两个例子:f(x) = 2x是线性的,f(x) = x²是非线性的。

【类比】线性就像弹簧,拉多少就伸长多少。非线性就像橡皮筋,拉得越多,越难拉。

Slide 18: 为什么需要非线性?

那么,为什么深度学习需要非线性呢?

【强调】这是深度学习的基本原理。

如果没有非线性,多层网络就等于单层网络,完全没有意义。

【指向证明】我们来证明一下:h(x) = W₂·(W₁·x) = W₃·x

两层线性变换的组合,还是一层线性变换。

但如果有非线性,多层网络就可以拟合任意复杂的函数。

【强调】所以,非线性是深度学习的核心!

Slide 19: 原始Attention是线性的

现在我们来看,原始Attention为什么是线性的。

【指向推导】Attention的计算分为三步:

步骤1:计算注意力权重A

步骤2:加权求和z = A·V,这是线性操作。

步骤3:输出投影o = z·Wₒ,这也是线性操作。

【强调】关键在于步骤2和步骤3都是线性的!

【指向组合】所以,o = (A·V)·Wₒ = A·V’

两个线性操作的组合还是线性!

Slide 20: 低秩瓶颈的数学证明

现在我们从数学上严格证明低秩瓶颈。

【指向定理】定理:线性变换不增加秩。rank(A·B) ≤ min(rank(A), rank(B))

【指向应用】在Attention中:rank(o) ≤ min(rank(V), d)

【强调】这说明什么?说明Wₒ无法增加V的秩!

输出的秩受限于V的秩,表达能力受限。

【类比】就像一张2维的纸,无论怎么折叠、旋转,它还是2维的,无法变成3维的立体。

【停顿】这是原始Attention的根本问题。

Slide 21: 门控引入非线性

那么,门控是怎么引入非线性的呢?

【指向结构】门控Attention的结构是:Linear → Sigmoid → Linear

【强调】关键是Sigmoid在中间插入了非线性!

【指向验证】我们来验证sigmoid确实是非线性的:sigmoid(2x) ≠ 2·sigmoid(x)

例子:sigmoid(2) = 0.88,2·sigmoid(1) = 1.46,不相等。

所以sigmoid是非线性函数。

Slide 22: 打破低秩瓶颈

现在我们来对比一下:

【指向对比】

原始Attention:Linear → Linear = Linear

门控Attention:Linear → NonLinear → Linear ≠ Linear

【强调】这是本质区别!

从数学上讲:

  • 原始:rank(o) ≤ rank(V)
  • 门控:rank(o) 可以 > rank(V)

非线性打破了秩的限制!

【类比】就像做菜,如果只是把食材混合(线性),味道有限。但如果中间加热(非线性),就能产生新的味道。

【停顿】这就是门控机制带来的非线性增益的核心原理。

Slide 23: 类比FFN

其实,这个思想在Transformer中已经有了。

【指向FFN】Feed-Forward Network的结构是:FFN(x) = ReLU(x·W₁)·W₂

也是Linear → ReLU → Linear。

【指向对比表格】门控Attention和FFN的对比:

两者都是在中间插入非线性,但门控更轻量,参数量更少。

【强调】所以门控更轻量,但同样有效!


第六部分:实验结果(3分钟)

Slide 24: 主要实验结果

好,理论分析完了,我们来看实验结果。

【指向实验设置】实验用的是1.3B参数的模型,在300B tokens上训练。

【指向表格】对比了四种激活函数:Sigmoid效果最好,PPL提升4.4%!

【强调】这验证了我们的理论分析:任何非线性都有帮助,而Sigmoid最适合做门控。

Slide 25: 消除Attention Sink

第二个重要结果是消除了Attention Sink。

【指向柱状图】F-Attr从46.7%降到4.8%,降低了90%!

【指向热力图】从热力图也可以看到,原始Attention的第一列很红,门控Attention的分布就均匀多了。

Slide 26: 长文本扩展

第三个重要发现是,门控Attention在长文本上更鲁棒。

【指向折线图】在128k序列长度时,改进达到11.5%!

【强调】序列越长,门控的优势越明显!

这说明门控Attention更适合处理长文本。

Slide 27: 训练稳定性

最后一个发现是训练更稳定。

【指向折线图】原始Attention出现了6次loss spikes,而门控Attention一次都没有。

为什么?

因为Sigmoid有界,输出在(0,1)之间,限制了激活值的范围,防止了massive activations,梯度更稳定。


第七部分:总结与展望(2分钟)

Slide 28: 核心贡献

好,我们来总结一下这篇论文的核心贡献。

【指向列表】

第一,揭示了原始Attention的三大缺陷。

第二,提出了简单但有效的解决方案:只加一个sigmoid门控。

第三,深入分析了非线性增益,有理论证明,也有实验验证。

第四,显著的性能提升:PPL提升4.4%,长文本更鲁棒。

Slide 29: 未来方向

未来还有很多可以研究的方向:

【指向列表】动态稀疏计算、更复杂的门控机制、应用到其他模型、理论分析等。

Slide 30: 总结

【指向大字】最后,用一句话总结这篇论文:

简单但深刻 - Simple but Profound

一行代码,三大改进,坚实的理论基础,显著的实验效果。

【强调】这就是好研究的标准!

谢谢大家!有什么问题吗?


🎯 演讲技巧提示

语速控制

  • 正常部分:每分钟120-150字
  • 重点部分:每分钟80-100字(放慢)
  • 过渡部分:每分钟150-180字(稍快)

停顿位置

  1. 讲完关键概念后:停顿2-3秒
  2. 提问后:停顿3-5秒
  3. 公式推导中:每步之间停顿1-2秒
  4. 部分结束时:停顿3-5秒

强调方式

  1. 音量:重点内容提高音量
  2. 语速:重点内容放慢语速
  3. 重复:关键结论重复一遍
  4. 手势:指向PPT的关键部分

互动技巧

  1. 眼神交流:不要一直看PPT,扫视全场
  2. 提问引导:“大家知道…吗?""为什么会这样呢?”
  3. 确认理解:“这个问题大家理解了吗?“

相关笔记

报告准备 演讲稿 gated-attention