AI 实践

Transformer 系列学习笔记:从注意力到投机解码

梳理 31 篇 Transformer 系列文章的知识地图,提炼从注意力机制、位置编码到 KV Cache 与投机解码的核心脉络。

· 约 3 分钟阅读

这份总览源于罗西的思考《探秘 Transformer 系列》31 篇文章。我的目标不是搬运,而是整理一张「从零到投机解码」的知识地图,标注每条脉络在自己项目里的落点。原系列地址见文末。

为什么重新系统学一遍

做医学 Agent 和多模态模型时,我发现自己对 Transformer 的理解是「够用但零散」的:能调 Attention,却说不清 RoPE 和长度外推的关系;用过 KV Cache,却没系统读过它的优化谱系。这个系列恰好补了这块。

知识地图:四个阶段

阶段一 · 基础机制(1–9)

  • (1)注意力机制
  • (2)总体架构
  • (3)数据处理
  • (4)编码器 & 解码器
  • (5)训练 & 推理
  • (6)token
  • (7)embedding
  • (8)位置编码
  • (9)位置编码分类

落点:我的 本地知识库 里,位置编码和 embedding 是直接复用最多的两块——做医学图文对齐时,位置信息的处理直接决定跨模态对齐质量。

阶段二 · 注意力内部(10–16)

  • (10)自注意力
  • (11)掩码
  • (12)多头自注意力
  • (13)FFN
  • (14)残差网络和归一化
  • (15)采样和输出
  • (16)资源占用

落点:多头注意力、掩码、采样策略,直接对应 智医助手 里 VLM Decider 的推理参数设计。

阶段三 · 位置与效率(17–29)

  • (17)RoPE
  • (18)FlashAttention
  • (19)FlashAttention V2 及升级版本
  • (20)KV Cache
  • (21)MoE
  • (22)LoRA
  • (23)长度外推
  • (24)KV Cache 优化
  • (25)KV Cache 优化之处理长文本序列
  • (26)KV Cache 优化—分离 or 合并
  • (27)MQA & GQA
  • (28)DeepSeek MLA
  • (29)DeepSeek MoE

落点:KV Cache 与 GQA/MQA 是本地 Ollama 推理能否跑起来的关键;LoRA 决定了我能不能在单卡上微调医学小模型。

阶段四 · 推理加速(30–31)

  • (30)投机解码
  • (31)Medusa

落点:投机解码和 Medusa 是「小模型兜底、大模型精修」架构的工程基础——正好对应智医助手网关在熔断时降级到本地模型的思路。

一条贯穿始终的主线

如果只记一件事:Transformer 的演进主线是 「在保持表达力的前提下,持续压低注意力与解码的计算与显存成本」。位置编码(RoPE)、注意力优化(FlashAttention / GQA)、参数高效(LoRA / MoE)、解码加速(投机解码 / Medusa),都是这条主线的不同切面。

后续专题计划

总览之后,我打算挑几条和项目强相关的做深:

  1. RoPE 与长度外推(直接关系医学长文本处理)
  2. KV Cache 优化谱系(关系本地推理成本)
  3. 投机解码 / Medusa(关系降级策略体验)

每写完一篇,会在这里补上链接。

参考

继续阅读