# 大模型方向暑假学习路线(8 月 - 9 月) > 给 Deshill,2026-08-04(术后第二天) > 目标:从"不知道怎么学"到"每天知道该干什么" --- ## 0. 先定位:你要学的不是"大模型",是一条很窄的路 "我想做大模型研究生"太宽了 —— 宽到让人瘫痪。 **程彭洲老师已经给你划过重点了**: > **"把 LLM 的强化学习学清楚,神经网络这些没啥意义"** > **重点:DPO、GRPO、PPO、RLHF** > **方向:智能体 + 智能体安全** 翻译成人话,你要学的是: ``` LLM 后训练(Post-training) ├── 对齐(Alignment):RLHF / DPO / GRPO / PPO ← 主战场 └── Agent 安全:内生安全 + 行为安全 ← 差异化 ``` **不是**:Transformer 从零实现、CNN、RNN、LSTM、GAN、传统 NLP。 那些是本科课程内容,你已经过了那关,不需要回头。 --- ## 1. 四周路线表(8 月 4 日 - 8 月 31 日) ### 📅 Week 1(8/4-8/10):术后恢复周 — **只读不动手** **身体状态**:前两周禁运动、坐久了不舒服 → 这周**只做躺着能做的事**:看视频、读论文、看博客。 | 天 | 内容 | 时长 | |---|---|---| | Day 1-2 | 看完 **Karpathy 的 "Deep Dive into LLMs"**(YouTube,约 3.5h)| 分 2-3 次看 | | Day 3 | 读 **InstructGPT 论文**(RLHF 的起点)| 1.5h | | Day 4 | 读 **DPO 论文**(Direct Preference Optimization)| 2h | | Day 5 | 读 **DeepSeek-R1 论文**(GRPO 的实战版)| 2h | | Day 6-7 | 看 **HuggingFace TRL 文档**(不动手,只读)| 2h | **这周唯一的目标**:**建立词汇表**。 让 RLHF / reward model / KL penalty / preference pair / policy / rollout / advantage 这些词从"陌生"变成"听过"。 --- ### 📅 Week 2(8/11-8/17):跑通第一个 DPO **身体状态**:可以坐了,但还不能运动。 | 天 | 内容 | |---|---| | Day 1 | 装环境(**直接用 Docker,别自己配 CUDA**,见下方 §4)| | Day 2-3 | 用 **TRL 的 DPOTrainer** 跑通一个最小 demo:Qwen2.5-0.5B + 一个小偏好数据集 | | Day 4 | 跑通后,**改一个超参**(beta),看结果怎么变 | | Day 5-6 | 写一篇笔记:**"我是怎么跑通第一个 DPO 的"**(发知乎/博客)| | Day 7 | 休息 / 补看 PPO 原理 | **这周唯一的目标**:**手上有一个能跑的 DPO 脚本**。 不追求效果好,只追求"我跑过"。 > ⚠️ 关键心态:**跑通 > 理解透**。先让代码跑起来,理解会在跑的过程中自然发生。 > 反过来"先完全理解再动手"= 永远不动手。 --- ### 📅 Week 3(8/18-8/24):GRPO + 推免材料并行 **身体状态**:术后第 3 周,可以慢走了。 | 天 | 内容 | |---|---| | Day 1-2 | 跑通 **GRPO**(TRL 的 GRPOTrainer),对比 DPO 的差别 | | Day 3 | 弄懂 **PPO → DPO → GRPO 的演化逻辑**(为什么后者更简单)| | Day 4-5 | **⭐ 推免材料准备**(学院通知应该已发,见 §5)| | Day 6-7 | 读 2-3 篇 **Agent 安全** 论文(prompt injection / jailbreak / tool misuse)| --- ### 📅 Week 4(8/25-8/31):收口 + 交付 | 天 | 内容 | |---|---| | Day 1-2 | **⭐ 提交推免材料**(8 月底死线)| | Day 3-4 | 整理一份 **"我的技术栈 + 已做工作"** 一页纸(9 月双选/复试要用)| | Day 5-6 | 把 DPO/GRPO 的实验整理成 GitHub repo(**这是给导师看的凭证**)| | Day 7 | 复盘,规划 9 月 | --- ## 2. 具体学什么:一份不会走偏的清单 ### 🎬 视频(先看这个,最省力) | 资源 | 说明 | |---|---| | **Karpathy - Deep Dive into LLMs like ChatGPT** | ⭐ 最推荐。3.5h 讲完预训练→SFT→RLHF 全流程,讲人话 | | **Karpathy - Let's build GPT** | 如果对 Transformer 还有点虚,看这个 | | **HuggingFace - RLHF 讲解视频** | 短,补充用 | > 中文的话,B 站搜 **"RLHF 原理"**、**"DPO 论文精读"**(李沐的论文精读系列有相关) ### 📄 必读论文(就这 5 篇,按顺序) | # | 论文 | 为什么读 | 难度 | |---|---|---|---| | 1 | **InstructGPT** (2022) | RLHF 的起点,理解"为什么需要对齐" | ⭐⭐ | | 2 | **DPO** (2023) | 把 RLHF 从 3 阶段简化成 1 阶段,**最重要** | ⭐⭐⭐ | | 3 | **DeepSeek-R1** (2025) | GRPO 的实战典范,中国团队,好读 | ⭐⭐⭐ | | 4 | **Constitutional AI** (Anthropic) | RLAIF,用 AI 反馈替代人工 | ⭐⭐ | | 5 | **Agent 安全综述**(任选一篇 2025 的)| 你的差异化方向 | ⭐⭐ | **读论文的方法**(别逐字读,会读死): ``` 第一遍(10 分钟):只读 Abstract + Introduction 最后一段 + 图表 → 搞清楚"它解决什么问题" 第二遍(40 分钟):读 Method 部分 → 搞清楚"它怎么做的" 第三遍(可选): 读实验 → 只有你要复现时才需要 ``` ### 💻 代码库(只需要一个) | 库 | 说明 | |---|---| | **HuggingFace TRL** | ⭐ 唯一必须掌握的。DPOTrainer / GRPOTrainer / PPOTrainer 都在里面 | | (可选)**OpenRLHF** | 更工程化,做大规模训练时再看 | | (可选)**verl** | 字节的 RL 框架,工业级 | **别一开始就看 OpenRLHF/verl** —— 代码量大,会淹死。TRL 的 example 是最小可运行单元。 --- ## 3. 每天怎么安排(术后版) ### 🛌 恢复期(本周,Week 1) ``` 上午(1 小时):看视频 / 读论文 ← 脑子最清醒的时候 下午(1 小时):随便看点轻的(博客、知乎、B站) 晚上: 休息、玩游戏、不学 ``` **总量:每天 2 小时就够了。** 你在恢复期,别给自己上强度。 ### 💪 恢复后(Week 2 起) ``` 上午 2 小时:硬核(跑代码 / 读论文) 下午 1 小时:软的(看文档、写笔记) 晚上: 不学 ``` **关键原则:宁可每天 2 小时坚持 28 天,不要一天 10 小时然后崩 3 天。** (这个你 8/2 已经验证过了 —— 通宵之后整个白天报废) --- ## 4. 环境怎么搭(用你昨天学的 Docker) **别在本机装 CUDA / PyTorch,会浪费你 3 天。** ### 有 GPU 的话(服务器 / 实验室机器) ```bash docker run --gpus all -it \ -v $(pwd):/workspace \ -p 8888:8888 \ --name llm-lab \ pytorch/pytorch:2.4.0-cuda12.1-cudnn9-devel bash # 进去后 pip install trl peft transformers datasets accelerate bitsandbytes ``` ### 没有 GPU 的话(三个白嫖方案) | 平台 | 免费额度 | 说明 | |---|---|---| | **Google Colab** | T4 免费 | ⭐ 最方便,直接跑 notebook | | **Kaggle Notebooks** | 每周 30h P100/T4 | 额度比 Colab 大 | | **阿里云 PAI-DSW** | 有免费额度 | 国内网络快 | | **AutoDL** | 便宜,1-2 元/小时 | 国内,按需租 4090 | **推荐**:**先用 Colab 免费 T4 跑 Qwen2.5-0.5B 的 DPO** —— 小模型完全够,重点是跑通流程,不是练出好模型。 --- ## 5. 保研线:现在到底该做什么 ### ✅ 现在(8 月上旬) - **什么都不用做**,正式通知还没发 - 每天/隔天瞄一眼年级群就行(**这个已经有提醒了**) ### ⏰ 8 月中旬(通知发出后) - [ ] 下载材料清单,**逐项对照准备** - [ ] 去教务处开**成绩单 + 专业排名证明**(6/96) - [ ] 准备 **iCoLoc 论文录用通知/接收邮件**扫描件 - [ ] 准备 **蓝桥杯国二获奖证书**扫描件 - [ ] CET6 成绩单(437,加 0.2 分) - [ ] 各类荣誉、志愿服务、讲座记录 ### ⭐ 8 月底 - [ ] **提交材料到学院(死线)** ### 9 月中旬 - [ ] 学院公示推免名单 → **拿到桂电保研资格** ### 9 月下旬 - [ ] 教育部推免系统开放(yz.chsi.com.cn/tm) - [ ] **填报上大计信院 + 通过双选** - [ ] 同步保底:北邮 / 同济 / 华师 / 华东理工 ### 拿到录取后 - [ ] **联系 Zhou + 程老师,进课题组** --- ## 6. 一件能立刻拉开差距的事 **做一个 GitHub repo,名字就叫 `llm-alignment-notes`。** 里面放: ``` llm-alignment-notes/ ├── README.md ← 学习路线 + 进度 ├── papers/ │ ├── dpo.md ← 你读 DPO 的笔记 │ ├── grpo.md │ └── instructgpt.md ├── experiments/ │ ├── dpo_qwen05b/ ← 能跑的代码 + 结果 │ └── grpo_qwen05b/ └── notes/ └── ppo-dpo-grpo-对比.md ``` **为什么这个重要?** 9 月你联系程老师的时候,可以说: > **"老师,您上次提到让我把 LLM 的强化学习学清楚。这个暑假我按 DPO → GRPO → PPO 的顺序学了,跑通了 TRL 的 DPO 和 GRPO,笔记和代码在这里:[链接]"** **这句话的杀伤力,比任何自我介绍都强。** 而且这是**可积累的**:现在写的每一篇笔记,9 月都是你的凭证。 --- ## 7. 关于焦虑,说句实话 你自己已经说对了: > "焦虑都是自己生产的,只要在做或者学习过程中焦虑就会消去" **但你漏了一步**:焦虑不会因为"开始做"就消失,它会因为**"知道下一步做什么"**而消失。 你这几天焦虑的真正原因不是"没学习",是**"我不知道该学什么"** —— 大脑在一个没有路径的空间里乱撞,撞不出结果,只能撞出焦虑。 **现在你有路径了。** 明天上午打开 Karpathy 那个视频,看 40 分钟。就这一件事。 **焦虑不是靠想通的,是靠"下一步很明确"消掉的。** --- ## 📌 今天/明天的第一步(只有一个) ``` 打开 YouTube / B站,搜 "Karpathy Deep Dive into LLMs" 躺着看 40 分钟 ``` **就这样。不用做笔记,不用听懂全部。看完这 40 分钟,你今天就赢了。** --- 🍃