# 📚 Transformer 学习笔记 · 总目录 > 为 Deshill 量身整理 · by 小小叶 🍃 · OpenClaw > 一套从**原理 → 直观理解 → 公式推导 → 时序应用 → 代码实战**的完整学习路径。 --- ## 📖 阅读顺序(建议从上到下) | 序号 | 文件 | 内容 | 难度 | |---|---|---|---| | 00 | `00_总目录.md` | 本文件,学习路线图 | ⭐ | | 01 | `01_原理与整体结构.md` | Transformer 是什么、为什么取代 RNN、整体架构 | ⭐⭐ | | 02 | `02_直观理解_加权平均.md` | **核心灵魂**:注意力 = 按相关性加权平均 | ⭐⭐ | | 03 | `03_公式推导.md` | Q/K/V、Self-Attention、Multi-Head、位置编码 的数学 | ⭐⭐⭐ | | 04 | `04_时间序列预测应用.md` | 怎么把 Transformer 用到时序预测 | ⭐⭐⭐ | | 05 | `05_代码实战与可视化.md` | 可运行代码 + 注意力热力图实验结果 | ⭐⭐⭐ | --- ## 🎯 一句话抓住全局 > **Transformer = 抛弃顺序处理、靠"注意力加权平均"一次看全局的序列模型。** > 注意力的本质:每个位置的新表示 = 所有位置信息的**加权平均**,权重由"相关性"动态决定。 --- ## 🧩 知识地图 ``` Transformer ├── 为什么出现? → 解决 RNN 不能并行 + 长距离遗忘 [01] ├── 核心机制 │ ├── Self-Attention(自注意力)= 加权平均 [02][03] │ │ ├── Q 查询 / K 键 / V 值 │ │ ├── 算权重: softmax(Q·Kᵀ/√d) │ │ └── 加权平均: 权重 · V │ ├── Multi-Head(多头)= 多视角的加权平均 [03] │ ├── 位置编码 = 补上"顺序"信息(sin/cos) [03] │ ├── Add & Norm = 残差 + 层归一化 [01] │ └── Mask = 防止偷看未来(自回归/时序关键) [03][04] ├── Encoder / Decoder 结构 [01] └── 应用:时间序列预测 [04][05] ├── 时序也是序列 → 加权平均找关键历史时刻 ├── 必须加 位置编码 + 因果 Mask └── 实验: 模型自动发现周期规律 [05] ``` --- ## ✅ 学完你能回答的问题 1. Transformer 为什么比 RNN 强?(并行 + 长程依赖) 2. 注意力机制到底在算什么?(加权平均,一句话) 3. Q/K/V 各是什么角色?(查询/标签/内容) 4. 为什么需要位置编码?(自注意力本身无序) 5. Multi-Head 的"多头"是怎么拆的?(d_model/h,**不是每头都用完整维度**) 6. 时间序列预测里,注意力帮你做了什么?(自动发现该参考哪些历史时刻) 7. 为什么时序预测必须加 Mask?(防止数据穿越/偷看未来) --- ## 📎 配套资源 - 知乎原文《Transformer模型详解(图解最完整版)》(作者: 初识CV) — 见 `/files/Transformer模型详解_图解最完整版_初识CV.md` - 可视化代码 `ts_transformer_attention_viz.py` — 见 `/files/` 根目录 - 论文:《Attention Is All You Need》 https://arxiv.org/abs/1706.03762 - 视频:李宏毅 Transformer https://www.youtube.com/watch?v=ugWDIIOHtPA --- *开始学习吧,从 `01_原理与整体结构.md` 出发 🚀*