这份总览源于罗西的思考《探秘 Transformer 系列》31 篇文章。我的目标不是搬运,而是整理一张「从零到投机解码」的知识地图,标注每条脉络在自己项目里的落点。原系列地址见文末。
为什么重新系统学一遍
做医学 Agent 和多模态模型时,我发现自己对 Transformer 的理解是「够用但零散」的:能调 Attention,却说不清 RoPE 和长度外推的关系;用过 KV Cache,却没系统读过它的优化谱系。这个系列恰好补了这块。
知识地图:四个阶段
阶段一 · 基础机制(1–9)
- (1)注意力机制
- (2)总体架构
- (3)数据处理
- (4)编码器 & 解码器
- (5)训练 & 推理
- (6)token
- (7)embedding
- (8)位置编码
- (9)位置编码分类
落点:我的 本地知识库 里,位置编码和 embedding 是直接复用最多的两块——做医学图文对齐时,位置信息的处理直接决定跨模态对齐质量。
阶段二 · 注意力内部(10–16)
- (10)自注意力
- (11)掩码
- (12)多头自注意力
- (13)FFN
- (14)残差网络和归一化
- (15)采样和输出
- (16)资源占用
落点:多头注意力、掩码、采样策略,直接对应 智医助手 里 VLM Decider 的推理参数设计。
阶段三 · 位置与效率(17–29)
- (17)RoPE
- (18)FlashAttention
- (19)FlashAttention V2 及升级版本
- (20)KV Cache
- (21)MoE
- (22)LoRA
- (23)长度外推
- (24)KV Cache 优化
- (25)KV Cache 优化之处理长文本序列
- (26)KV Cache 优化—分离 or 合并
- (27)MQA & GQA
- (28)DeepSeek MLA
- (29)DeepSeek MoE
落点:KV Cache 与 GQA/MQA 是本地 Ollama 推理能否跑起来的关键;LoRA 决定了我能不能在单卡上微调医学小模型。
阶段四 · 推理加速(30–31)
- (30)投机解码
- (31)Medusa
落点:投机解码和 Medusa 是「小模型兜底、大模型精修」架构的工程基础——正好对应智医助手网关在熔断时降级到本地模型的思路。
一条贯穿始终的主线
如果只记一件事:Transformer 的演进主线是 「在保持表达力的前提下,持续压低注意力与解码的计算与显存成本」。位置编码(RoPE)、注意力优化(FlashAttention / GQA)、参数高效(LoRA / MoE)、解码加速(投机解码 / Medusa),都是这条主线的不同切面。
后续专题计划
总览之后,我打算挑几条和项目强相关的做深:
- RoPE 与长度外推(直接关系医学长文本处理)
- KV Cache 优化谱系(关系本地推理成本)
- 投机解码 / Medusa(关系降级策略体验)
每写完一篇,会在这里补上链接。
参考
- 罗西的思考:《探秘 Transformer 系列之文章列表》(共 31 篇)