LLM PAPERS · READING GUIDE · 逐段精读

大模型核心论文精读
学习路线

四十三篇论文的逐段精读与延伸问答,按十个领域编排成一条从 Transformer 走到评测的完整路径。每一篇都标注了难度、时长与它在整个体系里的位置——从哪里开始、按什么顺序读、读的时候该带着什么问题。

43篇全文精读 | 10个知识领域 | 15篇主线必读 | 10篇面试指引 | ≈20小时读完
  1. 01
    Attention Is All You Need 主线必读

    一切的起点。读懂 Q/K/V、多头注意力与位置编码,是后面 42 篇的共同地基。

  2. 02
    BERT 必读

    双向编码器 + MLM 预训练的代表作,理解 encoder-only 路线与「预训练→微调」范式。

  3. 03
    GPT-2 补充

    「语言模型是无监督多任务学习者」:zero-shot 范式与 Decoder-only 路线的源头。

  1. 04
    Scaling Laws 主线必读

    模型/数据/算力的幂律关系,「规模信仰」的理论出处。

  2. 05
    Chinchilla 主线必读

    修正 Kaplan:tokens:params ≈ 20:1,compute-optimal 的训练配比黄金法则。

  3. 06
    LLaMA 必读

    过训练小模型 + 全公开数据:开源大模型生态的起点,RoPE/RMSNorm/SwiGLU 实战。

  4. 07
    RoBERTa 补充

    「BERT 训少了而非架构差」:数据量/步数/batch 的训练配方如何反超一众新架构。

  1. 08
    FLAN 必读

    指令微调开山:自然语言指令模板让 zero-shot 泛化成为可能。

  2. 09
    InstructGPT 主线必读

    RLHF 三步法(SFT→RM→PPO),ChatGPT 的直接技术前身。

  3. 10
    DPO 主线必读

    把「训 RM + 跑 RL」坍缩成一个二分类损失,对齐方法的简化里程碑。

  4. 11
    Constitutional AI 补充

    RLAIF 源头:AI 反馈替代人类标注无害性,人类只写「宪法」。

  5. 12
    KTO 补充

    不需要成对偏好数据的对齐:点赞/点踩这类单边信号也能训练。

  1. 13
    Chain-of-Thought 主线必读

    「Let's think step by step」:prompting 激活推理能力,2022 年最有影响力的发现之一。

  2. 14
    Self-Consistency 必读

    采样多条推理路径 + 多数投票:零训练、纯推理期提升准确率。

  3. 15
    Tree of Thoughts 必读

    把推理组织成树搜索(BFS/DFS + 评估回溯),test-time compute 的蓝图。

  4. 16
    ReAct 必读

    想—做—看—再想的交替循环:Agent 骨架的出处,兼有阶段八重定位小节。

  5. 17
    STaR 补充

    自举式推理:生成→按对错筛选→再训练,self-training 路线的经典闭环。

  1. 18
    LoRA 主线必读

    低秩适配:冻结大模型只训小矩阵,PEFT 的事实标准,微调民主化的功臣。

  2. 19
    FlashAttention 主线必读

    不改数学改搬运:IO-aware 分块计算,长上下文时代的隐形功臣。

  3. 20
    QLoRA 必读

    4-bit 冻结基座 + LoRA:单张 48GB 卡微调 65B,消费级微调的起点。

  4. 21
    LLM.int8() 补充

    8-bit 推理与「系统性 outlier」的发现:量化的坑在哪、怎么绕。

  5. 22
    DeepSpeed ZeRO 补充

    数据并行显存优化三阶段 + Offload:训练基础设施的标配。

  6. 23
    Megatron-LM 补充

    张量并行的开山之作:超大模型训练工程的地基。

  1. 24
    RoFormer / RoPE 主线必读

    旋转位置编码:用旋转把绝对位置写进 Q/K、内积只依赖相对距离,主流 LLM 标配。

  2. 25
    Ring Attention 必读

    KV block 环传 + 计算通信重叠:上下文容量随设备数近似线性扩展。

  3. 26
    LongLoRA 补充

    S²-Attn 训练省算力、推理保全注意力:拉长上下文的便宜方案。

  4. 27
    YaRN 补充

    NTK-aware 插值扩展 RoPE:10 倍 token 效率扩窗,社区实践升格为系统方法。

  5. 28
    Lost in the Middle 必读

    U 形注意力:开头结尾记得住、中间找不到——RAG 重排与截断的实证依据。

  1. 29
    RAG 主线必读

    检索增强开山:文档当潜变量做 marginalize,可更新、可溯源的知识接入。

  2. 30
    REALM 必读

    把检索做进预训练本身:MLM 信号端到端地训练检索器。

  3. 31
    Self-RAG 必读

    反思令牌:按需检索 + 自批判 + 可控解码,Agentic RAG 的先声。

  4. 32
    CRAG 补充

    检索质检层:评估→纠错→web 兜底→精炼,今天生产 RAG 的流水线雏形。

  1. 33
    Toolformer 主线必读

    模型自监督学会调 API:6.7B 零样本超 175B,「外挂能力 > 参数堆砌」的第一次证明。

  2. 34
    WebGPT 必读

    RLHF 进 Agent 场景:浏览器问答 + 引用,best-of-n 采样与 test-time compute 的祖先。

  3. 35
    ReAct(阶段四已覆盖,含 Agent 视角重定位) 补充

    零训练的 Agent 模板:Thought→Action→Observation 循环,LangChain 骨架的来源。

  4. 36
    GPT-4 Function Calling 必读

    工业收束:JSON Schema + 开发者可控的工具调用,把学术 hack 变成工程标准。

  1. 37
    CLIP 主线必读

    对比学习 + 4 亿图文对:zero-shot 视觉分类,「视觉侧的 GPT-2 时刻」。

  2. 38
    LLaVA 主线必读

    视觉指令微调:一个线性层连接 CLIP 与 LLM,data-centric 范式的多模态版本。

  3. 39
    BLIP-2 补充

    Q-Former 桥接冻结双塔:32 个 query 压缩视觉信息,重架构路线的代表。

  4. 40
    GPT-4V System Card 补充

    闭源完全体的安全视角:红队、拒绝策略、多模态越狱与部署边界。

  1. 41
    MMLU 主线必读

    57 学科四选一:大模型知识评测的 ImageNet,评测范式的奠基之作。

  2. 42
    HellaSwag 必读

    对抗式造数据:让模型出题考模型自己,专挑盲区的常识推理基准。

  3. 43
    BIG-bench 补充

    204 任务社区共建:涌现能力、校准与脆弱性的规模研究。

  4. 44
    GSM8K 主线必读

    数学应用题 + 验证器:生成-验证范式的起点,过程奖励模型(PRM)与 o1/R1 的前传。

  1. 先走主线,再开分支。标「主线必读」的 15 篇构成一条六到八周的核心路径,覆盖全部十个领域的主干概念;各阶段的「必读 / 补充」供你按需深入。
  2. 三步读法。先读每节的「要点」建立骨架,再读「精读」理解推导与设计动机,最后读「延伸讨论」——那里是真实问答中沉淀下来的批判性思考。
  3. 顺着连接线读。每篇笔记都标注了与前后论文的呼应:DPO 与 RLHF、Toolformer 与 Function Calling、CLIP 到 LLaVA 再到 BLIP-2。读懂这些连接线,比多读十篇孤立论文更有价值。
  4. 每阶段收口。读完一个阶段,回到左栏的「阶段目标」自测——能否向别人讲清楚这个领域解决什么问题、代表性方案各自站在哪。
ICP备案/许可证号:粤ICP备2026138155号