# 大模型对齐必读论文包 · 阅读指南 > 2026-08-04 · 给 Deshill > 全部下载自 arXiv,5 篇,按顺序读 --- ## 📄 论文清单 | # | 文件 | 原名 | 年份 | 难度 | 读多久 | |---|---|---|---|---|---| | 1 | `01_InstructGPT_RLHF起点.pdf` | Training language models to follow instructions with human feedback | 2022 | ⭐⭐ | 1.5h | | 2 | `02_DPO_直接偏好优化.pdf` | Direct Preference Optimization | 2023 | ⭐⭐⭐ | 2h | | 3 | `03_DeepSeek-R1_GRPO实战.pdf` | DeepSeek-R1: Incentivizing Reasoning Capability via RL | 2025 | ⭐⭐⭐ | 2h | | 4 | `04_Constitutional-AI_RLAIF.pdf` | Constitutional AI: Harmlessness from AI Feedback | 2022 | ⭐⭐ | 1.5h | | 5 | `05_LLM综述.pdf` | Large Language Models: A Survey | 2024 | ⭐⭐ | 按需查 | --- ## 🎯 每篇要带走什么(只记这些就够) ### 1️⃣ InstructGPT — RLHF 的起点 **核心问题**:为什么 GPT-3 很强但不好用? **要带走的**: - **三阶段流程**:SFT → 训练 Reward Model → PPO 优化 - **为什么需要 RM**:人类偏好没法写成 loss 函数,所以先训一个模型来"当人类" - **关键洞察**:1.3B 的 InstructGPT 人类偏好度**超过** 175B 的 GPT-3 → **对齐比规模更重要** **重点看**:Figure 2(三阶段流程图) --- ### 2️⃣ DPO — 最重要的一篇 ⭐ **核心问题**:RLHF 三阶段太复杂了,能不能一步搞定? **要带走的**: - **DPO 干掉了 Reward Model 和 PPO**,直接用偏好对 (chosen, rejected) 做监督学习 - **核心公式**(这个要能看懂): ``` L_DPO = -log σ( β·[log π(y_w|x)/π_ref(y_w|x) - log π(y_l|x)/π_ref(y_l|x)] ) ``` 白话:**让模型对"好回答"的概率相对参考模型上升,对"坏回答"下降** - **β 是什么**:控制"偏离参考模型的容忍度",越小越激进 - **为什么能这样**:论文证明了 RLHF 的最优解有闭式表达 → 可以反解成分类损失 **重点看**:Section 4(Method)+ 那个公式的推导思路(不用逐行推) --- ### 3️⃣ DeepSeek-R1 — GRPO 实战 **核心问题**:怎么用 RL 让模型学会"推理"? **要带走的**: - **GRPO = Group Relative Policy Optimization**:PPO 的简化版,**去掉了 Value Model** - 怎么去掉的:**同一个 prompt 采样一组(group)回答,用组内平均分当 baseline** - **R1-Zero 的惊人发现**:纯 RL(不用 SFT)就能自发涌现出"反思""重新验证"行为 - **"aha moment"**:模型自己学会说"等等,让我重新想想" **重点看**:Section 2.2(GRPO 算法)+ Table 3(aha moment 的例子) --- ### 4️⃣ Constitutional AI — RLAIF **核心问题**:人工标注太贵,能不能让 AI 自己标? **要带走的**: - **RLAIF**:用 AI 反馈替代人类反馈 - **"宪法"**:一组自然语言的原则,模型照着自我批评 + 修正 - 流程:**自我批评 → 自我修订 → 用修订结果训练** - **为什么和你相关**:**这是 Agent 安全的雏形** —— 内生安全(模型自己约束自己) **重点看**:Figure 1(整体流程) --- ### 5️⃣ LLM 综述 — 工具书 **不要通读**,当字典用。遇到不懂的概念(MoE / RoPE / Flash Attention / RAG)来这里查。 --- ## 📖 怎么读论文(重要,别逐字读) ### 三遍法 ``` 第一遍(10 分钟): 只读 Abstract + Introduction 最后一段 + 所有图表 → 目标:搞清楚"它解决什么问题、结果多好" 第二遍(40 分钟): 读 Method / Approach 部分 → 目标:搞清楚"它具体怎么做的" → 遇到公式:先看它想表达什么,别急着推导 第三遍(可选,只在要复现时): 读 Experiments + Appendix ``` ### 遇到看不懂的公式怎么办 **别卡住。** 三个办法: 1. 把公式贴给 AI(我或者 ChatGPT),说"用大白话解释这个公式在干什么" 2. 去 B 站搜"XX 论文精读",看别人怎么讲 3. **先跳过**,等你跑过代码再回来看 —— 代码会让公式变得直观 --- ## ✅ 建议的阅读顺序与节奏 | 天 | 读什么 | 目标 | |---|---|---| | **Day 1-2** | 先看 Karpathy 视频(不是论文)| 建立全局地图 | | **Day 3** | InstructGPT | 理解"为什么要对齐" | | **Day 4** | **DPO** ⭐ | 理解主流方法 | | **Day 5** | DeepSeek-R1 | 理解 GRPO | | **Day 6** | Constitutional AI | 衔接 Agent 安全 | | Day 7 | 休息 / 综述查漏 | — | --- ## 📝 读完每篇必做的一件事 **在 GitHub repo `llm-alignment-notes/papers/` 下写一个 md 文件**,格式: ```markdown # DPO 论文笔记 ## 一句话总结 DPO 用一个分类损失直接优化偏好,绕过了 Reward Model 和 PPO。 ## 它解决什么问题 RLHF 三阶段流程复杂、不稳定、算力贵。 ## 核心做法 (用你自己的话写,3-5 句) ## 关键公式 (抄下来 + 用大白话解释) ## 我还没懂的地方 - ... - ... ## 和我方向的关系 (比如:Agent 安全里怎么用 DPO 做安全对齐) ``` **"我还没懂的地方"这一栏最重要** —— 那是你 9 月可以问程老师的问题。 --- ## 🎬 视频资源(论文之外) | 资源 | 地址/搜索词 | |---|---| | **Karpathy - Deep Dive into LLMs like ChatGPT** | YouTube 搜标题,B 站有搬运字幕版 | | 李沐 - 论文精读系列 | B 站搜「李沐 论文精读」| | DPO 论文精读(中文) | B 站搜「DPO 论文精读」| | RLHF 原理讲解 | B 站搜「RLHF 原理」| --- ## 💻 代码(读完论文后动手) **只需要 HuggingFace TRL**: - 文档:https://huggingface.co/docs/trl - DPO 示例:`trl/examples/scripts/dpo.py` - GRPO 示例:`trl/examples/scripts/grpo.py` **第一个实验目标**:Qwen2.5-0.5B + 小偏好数据集,Colab 免费 T4 就能跑。 --- 🍃 **今天的任务:只看 Karpathy 视频 40 分钟。论文明天开始。**