论文精读
Attention Is All You Need:Transformer 架构的诞生
Google 提出的纯注意力机制架构,彻底抛弃 RNN/CNN 的序列建模范式,在机器翻译任务上取得 SOTA 并开启了后续大模型时代的基础架构。
Attention Is All You Need:Transformer 架构的诞生
这篇论文不需要过多介绍——它是整个现代 AI 的地基。从 BERT 到 GPT、从 ViT 到 Qwen,几乎所有大模型的骨架都源自这里。
它解决什么
在 Transformer 之前,序列建模的主流是 RNN(LSTM/GRU)及其变体。RNN 有两个根本缺陷:无法并行计算(必须逐步处理序列)和长距离依赖衰减(信息随步数增加而丢失)。虽然 CNN 在局部特征提取上表现出色,但在全局上下文建模上力不从心。
Transformer 用一个简洁的答案解决了这两个问题:全部用注意力机制。
方法要点
- 自注意力(Self-Attention):序列中每个位置都可以直接关注所有其他位置,一步到位建立全局依赖,且计算可完全并行。
- 多头注意力(Multi-Head Attention):多组独立的注意力头各自学习不同的表示子空间,拼接后线性投影——类似 CNN 多通道的思想。
- 位置编码(Positional Encoding):因为自注意力本身没有顺序概念,需要通过正弦/余弦函数或可学习的嵌入注入位置信息。
- 编码器-解码器架构:原始论文用于机器翻译,编码器处理源语言、解码器生成目标语言;但后续工作证明仅编码器(BERT 风格)或仅解码器(GPT 风格)同样强大。
- 残差连接 + Layer Normalization:每层子结构周围套 residual + layer norm,保证深层网络的训练稳定性。
结果
- 在 WMT 2014 英德/英法翻译任务上大幅超越当时最佳模型,训练速度比 RNN 基线快一个数量级。
- 泛化能力极强:同一架构只需更换数据即可用于不同任务——这为后来的“预训练-微调”范式铺平了道路。
- 论文发表后迅速成为 NLP 领域的标准架构,并在 2020 年前后被 Vision Transformer(ViT)成功迁移到计算机视觉领域,实现了真正的统一架构跨模态。
对我的启发
- 这篇是 31 篇 Transformer 学习笔记的源头和总纲。理解了原始论文的每个组件(Q/K/V 计算缩放点积、mask 机制、FFN 子层),后续所有变体(GQA/MQA、KV Cache、RoPE、Flash Attention)都是在做优化而非推翻。
- “Attention is all you need” 这个标题之所以经典,是因为它真的做到了——用一个核心机制统一了之前分散在 RNN/CNN/attention hybrid 里的各种设计。
- 从医学 AI 角度看,Transformer 架构已经渗透到影像分析(ViT/U-Net 变体)、报告生成(encoder-decoder)、多模态诊断(统一 Transformer)等各个环节。掌握原始架构是理解所有这些工作的前提。