Transformer深度剖析:ai-engineering-from-scratch Phase 7全部16课核心内容
Transformer 深度剖析是每一位 AI 工程师的必修课。开源课程项目 ai-engineering-from-scratch(AI 工程从零学起)用 20 个阶段、416 节课带你亲手写出分词器、注意力机制和 Agent 循环;其中 Phase 7 正是全部 16 课的 Transformer 核心内容——从"为什么需要 Transformer"讲到 KV Cache、Flash Attention 与推测解码,每一课都配套可运行的 Python 代码。本文带你快速过一遍这 16 课的核心内容,判断它是否适合你,以及如何用最少的路径走完全程。
📚 Phase 7 课程总览:16 课学完 Transformer 全部核心
Phase 7 官方定位为"改变一切的架构,理解它的每一层"。先修要求是 Phase 3(深度学习核心)以及 Phase 5 的 Seq2Seq 与注意力两课。16 课按"动机 → 构件 → 组装 → 应用 → 优化"的清晰主线展开:
| 课号 | 课程 | 类型 | 核心问题 |
|---|---|---|---|
| 01 | Why Transformers | 学习 | RNN 的三大致命弱点,为什么并行深度改变硬件叙事 |
| 02 | Self-Attention from Scratch | 动手 | 注意力是一张"谁对我重要"的可学习查表 |
| 03 | Multi-Head Attention | 动手 | 一个头学一种关系,八个头学八种 |
| 04 | Positional Encoding | 动手 | 正弦编码、RoPE、ALiBi 三种"位置"的赌注 |
| 05 | The Full Transformer | 动手 | 残差、归一化、前馈、交叉注意力如何搭起骨架 |
| 06 | BERT — MLM | 动手 | 预测缺失词,嵌入模型的十年根基 |
| 07 | GPT — Causal LM | 动手 | 三角掩码:现代 AI 最关键的一行代码 |
| 08 | T5 / BART | 学习 | 编码器理解 + 解码器生成的 seq2seq 组合 |
| 09 | ViT | 动手 | 图像是 patch 网格,同一套 Transformer 通吃 |
| 10 | Whisper | 学习 | 音频是"频率×时间"的图,Whisper 是吃声谱图的 ViT |
| 11 | Mixture of Experts | 动手 | 671B 参数只激活 37B,稀疏是十年的关键思想 |
| 12 | KV Cache & Flash Attention | 动手 | 训练受算力约束,推理受内存约束,技巧完全不同 |
| 13 | Scaling Laws | 学习 | 算力该分给参数还是 token?Chinchilla 的答案 |
| 14 | Build a Transformer | 动手 | 从零搭建完整 Transformer 的收官项目 |
| 15 | Attention Variants | 动手 | 滑动窗口、稀疏、差分:四种变体砍掉一半成本 |
| 16 | Speculative Decoding | 动手 | 小模型起草、大模型批量验证,打破串行解码 |
课程入口与完整清单见 phases/07-transformers-deep-dive/README.md。
🔍 核心内容拆解:四段式学习主线
第 1 段(01–05 课):把 Transformer 拆开再装回去
- 第 01 课用数值模拟量化 RNN 的串行瓶颈:1024 个 token 意味着 1024 步串行依赖,GPU 99% 的算力被浪费;而注意力一次矩阵乘就填满整个 N×N 矩阵。代价是 O(N²) 的注意力内存——这个伏笔在第 12、15 课回收。
- 第 02 课从零实现 Self-Attention,理解 Q/K/V 就是"查询、键、值"三张查表。参考实现:self_attention.py。
- 第 03 课讲多头注意力:头是廉价的,多取几个,每个头负责一种关系(语法、指代、位置相邻……)。
- 第 04 课对比三种位置编码:正弦(可外推但衰减)、RoPE(相对位置、当前主流)、ALiBi(线性偏置、免训练)。
- 第 05 课把注意力、前馈网络、残差连接和 LayerNorm 组装成完整 Encoder + Decoder 块,这是后面所有课程的公共地基。
第 2 段(06–08 课):三大预训练模型家族
- BERT(06 课):双向看上下文,预测被掩码的词,产出嵌入——今天所有 RAG 检索的底座。
- GPT(07 课):因果掩码让它只能看过去,于是"预测下一个 token"可以无限续写;采样温度、top-k 等参数在这节课调出手感。
- T5/BART(08 课):把编码器和解码器重新拼起来,专攻"输入 → 输出"任务:翻译、摘要、改写、转写。
一句话记忆:BERT 预测缺失词,GPT 预测下一个词,T5 做整句对整句——差一句训练目标,分出半个应用生态。
第 3 段(09–13 课):多模态扩展与规模规律
- ViT(09 课):把图像切成 patch,就变成"token 网格",同一个 Transformer 直接吃图。
- Whisper(10 课):把 mel 声谱图当作"频率×时间的图像",本质是"会说话的 ViT",理解音频模型架构的一把钥匙。
- MoE(11 课):用路由网关让每个 token 只激活部分专家——参数多 10 倍、单 token 算力不涨,这是当前大模型的主流路线。
- Scaling Laws(13 课):Kaplan(2020)说"越大越好",Chinchilla(2022)纠正"你训少了";算力要在参数量和 token 数之间做非显然的分配。
第 4 段(12、15、16 课):推理优化三板斧
- KV Cache + Flash Attention(12 课):推理是串行的、受内存带宽约束——缓存 K/V、分块计算,是现代推理引擎的两块基石。
- 注意力变体(15 课):滑窗、稀疏、差分、线性注意力,四种方式把 O(N²) 的成本砍半,支撑 128K 级长上下文。
- 推测解码(16 课):小模型起草 N 个 token,大模型一次前向全部验证,串行链条被"批发式"打破,是理解 vLLM、TensorRT-LLM 加速原理的最后一块拼图。
🗺️ 学习路径建议:两条路线任选
路线 A · 完整通关(推荐):按 01 → 16 顺序学完。每课 45–90 分钟,全程约 20 小时,动手课均有独立可运行代码,例如第一课:
python3 phases/07-transformers-deep-dive/01-why-transformers/code/main.py
路线 B · 只学最核心:时间紧张就抓 01 → 02 → 03 → 05 → 07 → 12 六课,约 7 小时,即可读懂"Transformer 为什么快、怎么组装、GPT 怎么训、推理怎么优化"这条主干。
💡 提示:动手课(Build)的验收标准写在每课的 docs/en.md 中,建议"先读概念 → 再跑代码 → 后改参数"三步走。
✅ 总结:这套课程值不值得学
- 无框架黑盒:全部核心用原生 Python 实现,学完你知道每一层的"为什么",而不是"怎么调 API"。
- 主线完整:从 RNN 的失败讲到推测解码,16 课没有一节课是孤立的,伏笔和回收一一对应。
- 衔接后续:Phase 10(LLM 从零构建)与 Phase 11(LLM 工程)直接建立在 Phase 7 之上,学完即可进入 RAG、微调与 Agent 工程。
想继续深入,可参考总课程目录 README.md 与跨阶段路线图 ROADMAP.md,从 Phase 3 补起前修知识,再用 Phase 7 把 Transformer 彻底吃透。
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考




