Transformer深度剖析:ai-engineering-from-scratch Phase 7全部16课核心内容

Transformer深度剖析:ai-engineering-from-scratch Phase 7全部16课核心内容

【免费下载链接】ai-engineering-from-scratch Learn it. Build it. Ship it for others. 【免费下载链接】ai-engineering-from-scratch 项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch

Transformer 深度剖析是每一位 AI 工程师的必修课。开源课程项目 ai-engineering-from-scratch(AI 工程从零学起)用 20 个阶段、416 节课带你亲手写出分词器、注意力机制和 Agent 循环;其中 Phase 7 正是全部 16 课的 Transformer 核心内容——从"为什么需要 Transformer"讲到 KV Cache、Flash Attention 与推测解码,每一课都配套可运行的 Python 代码。本文带你快速过一遍这 16 课的核心内容,判断它是否适合你,以及如何用最少的路径走完全程。

Transformer 深度剖析:ai-engineering-from-scratch 课程封面,涵盖 Math 到 Agents 分层

📚 Phase 7 课程总览:16 课学完 Transformer 全部核心

Phase 7 官方定位为"改变一切的架构,理解它的每一层"。先修要求是 Phase 3(深度学习核心)以及 Phase 5 的 Seq2Seq 与注意力两课。16 课按"动机 → 构件 → 组装 → 应用 → 优化"的清晰主线展开:

课号课程类型核心问题
01Why Transformers学习RNN 的三大致命弱点,为什么并行深度改变硬件叙事
02Self-Attention from Scratch动手注意力是一张"谁对我重要"的可学习查表
03Multi-Head Attention动手一个头学一种关系,八个头学八种
04Positional Encoding动手正弦编码、RoPE、ALiBi 三种"位置"的赌注
05The Full Transformer动手残差、归一化、前馈、交叉注意力如何搭起骨架
06BERT — MLM动手预测缺失词,嵌入模型的十年根基
07GPT — Causal LM动手三角掩码:现代 AI 最关键的一行代码
08T5 / BART学习编码器理解 + 解码器生成的 seq2seq 组合
09ViT动手图像是 patch 网格,同一套 Transformer 通吃
10Whisper学习音频是"频率×时间"的图,Whisper 是吃声谱图的 ViT
11Mixture of Experts动手671B 参数只激活 37B,稀疏是十年的关键思想
12KV Cache & Flash Attention动手训练受算力约束,推理受内存约束,技巧完全不同
13Scaling Laws学习算力该分给参数还是 token?Chinchilla 的答案
14Build a Transformer动手从零搭建完整 Transformer 的收官项目
15Attention Variants动手滑动窗口、稀疏、差分:四种变体砍掉一半成本
16Speculative Decoding动手小模型起草、大模型批量验证,打破串行解码

课程入口与完整清单见 phases/07-transformers-deep-dive/README.md

🔍 核心内容拆解:四段式学习主线

第 1 段(01–05 课):把 Transformer 拆开再装回去

  • 第 01 课用数值模拟量化 RNN 的串行瓶颈:1024 个 token 意味着 1024 步串行依赖,GPU 99% 的算力被浪费;而注意力一次矩阵乘就填满整个 N×N 矩阵。代价是 O(N²) 的注意力内存——这个伏笔在第 12、15 课回收。
  • 第 02 课从零实现 Self-Attention,理解 Q/K/V 就是"查询、键、值"三张查表。参考实现:self_attention.py
  • 第 03 课讲多头注意力:头是廉价的,多取几个,每个头负责一种关系(语法、指代、位置相邻……)。
  • 第 04 课对比三种位置编码:正弦(可外推但衰减)、RoPE(相对位置、当前主流)、ALiBi(线性偏置、免训练)。
  • 第 05 课把注意力、前馈网络、残差连接和 LayerNorm 组装成完整 Encoder + Decoder 块,这是后面所有课程的公共地基。

第 2 段(06–08 课):三大预训练模型家族

  • BERT(06 课):双向看上下文,预测被掩码的词,产出嵌入——今天所有 RAG 检索的底座。
  • GPT(07 课):因果掩码让它只能看过去,于是"预测下一个 token"可以无限续写;采样温度、top-k 等参数在这节课调出手感。
  • T5/BART(08 课):把编码器和解码器重新拼起来,专攻"输入 → 输出"任务:翻译、摘要、改写、转写。

一句话记忆:BERT 预测缺失词,GPT 预测下一个词,T5 做整句对整句——差一句训练目标,分出半个应用生态。

第 3 段(09–13 课):多模态扩展与规模规律

  • ViT(09 课):把图像切成 patch,就变成"token 网格",同一个 Transformer 直接吃图。
  • Whisper(10 课):把 mel 声谱图当作"频率×时间的图像",本质是"会说话的 ViT",理解音频模型架构的一把钥匙。
  • MoE(11 课):用路由网关让每个 token 只激活部分专家——参数多 10 倍、单 token 算力不涨,这是当前大模型的主流路线。
  • Scaling Laws(13 课):Kaplan(2020)说"越大越好",Chinchilla(2022)纠正"你训少了";算力要在参数量和 token 数之间做非显然的分配。

第 4 段(12、15、16 课):推理优化三板斧

  • KV Cache + Flash Attention(12 课):推理是串行的、受内存带宽约束——缓存 K/V、分块计算,是现代推理引擎的两块基石。
  • 注意力变体(15 课):滑窗、稀疏、差分、线性注意力,四种方式把 O(N²) 的成本砍半,支撑 128K 级长上下文。
  • 推测解码(16 课):小模型起草 N 个 token,大模型一次前向全部验证,串行链条被"批发式"打破,是理解 vLLM、TensorRT-LLM 加速原理的最后一块拼图。

🗺️ 学习路径建议:两条路线任选

路线 A · 完整通关(推荐):按 01 → 16 顺序学完。每课 45–90 分钟,全程约 20 小时,动手课均有独立可运行代码,例如第一课:

python3 phases/07-transformers-deep-dive/01-why-transformers/code/main.py

路线 B · 只学最核心:时间紧张就抓 01 → 02 → 03 → 05 → 07 → 12 六课,约 7 小时,即可读懂"Transformer 为什么快、怎么组装、GPT 怎么训、推理怎么优化"这条主干。

💡 提示:动手课(Build)的验收标准写在每课的 docs/en.md 中,建议"先读概念 → 再跑代码 → 后改参数"三步走。

✅ 总结:这套课程值不值得学

  • 无框架黑盒:全部核心用原生 Python 实现,学完你知道每一层的"为什么",而不是"怎么调 API"。
  • 主线完整:从 RNN 的失败讲到推测解码,16 课没有一节课是孤立的,伏笔和回收一一对应。
  • 衔接后续:Phase 10(LLM 从零构建)与 Phase 11(LLM 工程)直接建立在 Phase 7 之上,学完即可进入 RAG、微调与 Agent 工程。

想继续深入,可参考总课程目录 README.md 与跨阶段路线图 ROADMAP.md,从 Phase 3 补起前修知识,再用 Phase 7 把 Transformer 彻底吃透。

【免费下载链接】ai-engineering-from-scratch Learn it. Build it. Ship it for others. 【免费下载链接】ai-engineering-from-scratch 项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值