论文精读

Attention Is All You Need:Transformer 架构的诞生

Google 提出的纯注意力机制架构,彻底抛弃 RNN/CNN 的序列建模范式,在机器翻译任务上取得 SOTA 并开启了后续大模型时代的基础架构。

· 约 3 分钟阅读

Attention Is All You Need:Transformer 架构的诞生

这篇论文不需要过多介绍——它是整个现代 AI 的地基。从 BERT 到 GPT、从 ViT 到 Qwen,几乎所有大模型的骨架都源自这里。

它解决什么

在 Transformer 之前,序列建模的主流是 RNN(LSTM/GRU)及其变体。RNN 有两个根本缺陷:无法并行计算(必须逐步处理序列)和长距离依赖衰减(信息随步数增加而丢失)。虽然 CNN 在局部特征提取上表现出色,但在全局上下文建模上力不从心。

Transformer 用一个简洁的答案解决了这两个问题:全部用注意力机制

方法要点

  • 自注意力(Self-Attention):序列中每个位置都可以直接关注所有其他位置,一步到位建立全局依赖,且计算可完全并行。
  • 多头注意力(Multi-Head Attention):多组独立的注意力头各自学习不同的表示子空间,拼接后线性投影——类似 CNN 多通道的思想。
  • 位置编码(Positional Encoding):因为自注意力本身没有顺序概念,需要通过正弦/余弦函数或可学习的嵌入注入位置信息。
  • 编码器-解码器架构:原始论文用于机器翻译,编码器处理源语言、解码器生成目标语言;但后续工作证明仅编码器(BERT 风格)或仅解码器(GPT 风格)同样强大
  • 残差连接 + Layer Normalization:每层子结构周围套 residual + layer norm,保证深层网络的训练稳定性。

结果

  • 在 WMT 2014 英德/英法翻译任务上大幅超越当时最佳模型,训练速度比 RNN 基线快一个数量级。
  • 泛化能力极强:同一架构只需更换数据即可用于不同任务——这为后来的“预训练-微调”范式铺平了道路。
  • 论文发表后迅速成为 NLP 领域的标准架构,并在 2020 年前后被 Vision Transformer(ViT)成功迁移到计算机视觉领域,实现了真正的统一架构跨模态

对我的启发

  • 这篇是 31 篇 Transformer 学习笔记的源头和总纲。理解了原始论文的每个组件(Q/K/V 计算缩放点积、mask 机制、FFN 子层),后续所有变体(GQA/MQA、KV Cache、RoPE、Flash Attention)都是在做优化而非推翻。
  • “Attention is all you need” 这个标题之所以经典,是因为它真的做到了——用一个核心机制统一了之前分散在 RNN/CNN/attention hybrid 里的各种设计。
  • 从医学 AI 角度看,Transformer 架构已经渗透到影像分析(ViT/U-Net 变体)、报告生成(encoder-decoder)、多模态诊断(统一 Transformer)等各个环节。掌握原始架构是理解所有这些工作的前提。

继续阅读