-
04
Scaling Laws 主线必读
模型/数据/算力的幂律关系,「规模信仰」的理论出处。
-
05
Chinchilla 主线必读
修正 Kaplan:tokens:params ≈ 20:1,compute-optimal 的训练配比黄金法则。
-
06
LLaMA 必读
过训练小模型 + 全公开数据:开源大模型生态的起点,RoPE/RMSNorm/SwiGLU 实战。
-
07
RoBERTa 补充
「BERT 训少了而非架构差」:数据量/步数/batch 的训练配方如何反超一众新架构。
-
08
FLAN 必读
指令微调开山:自然语言指令模板让 zero-shot 泛化成为可能。
-
09
InstructGPT 主线必读
RLHF 三步法(SFT→RM→PPO),ChatGPT 的直接技术前身。
-
10
DPO 主线必读
把「训 RM + 跑 RL」坍缩成一个二分类损失,对齐方法的简化里程碑。
-
11
RLAIF 源头:AI 反馈替代人类标注无害性,人类只写「宪法」。
-
12
KTO 补充
不需要成对偏好数据的对齐:点赞/点踩这类单边信号也能训练。
-
13
Chain-of-Thought 主线必读
「Let's think step by step」:prompting 激活推理能力,2022 年最有影响力的发现之一。
-
14
采样多条推理路径 + 多数投票:零训练、纯推理期提升准确率。
-
15
把推理组织成树搜索(BFS/DFS + 评估回溯),test-time compute 的蓝图。
-
16
ReAct 必读
想—做—看—再想的交替循环:Agent 骨架的出处,兼有阶段八重定位小节。
-
17
STaR 补充
自举式推理:生成→按对错筛选→再训练,self-training 路线的经典闭环。
-
18
LoRA 主线必读
低秩适配:冻结大模型只训小矩阵,PEFT 的事实标准,微调民主化的功臣。
-
19
FlashAttention 主线必读
不改数学改搬运:IO-aware 分块计算,长上下文时代的隐形功臣。
-
20
QLoRA 必读
4-bit 冻结基座 + LoRA:单张 48GB 卡微调 65B,消费级微调的起点。
-
21
LLM.int8() 补充
8-bit 推理与「系统性 outlier」的发现:量化的坑在哪、怎么绕。
-
22
数据并行显存优化三阶段 + Offload:训练基础设施的标配。
-
23
Megatron-LM 补充
张量并行的开山之作:超大模型训练工程的地基。
-
24
RoFormer / RoPE 主线必读
旋转位置编码:用旋转把绝对位置写进 Q/K、内积只依赖相对距离,主流 LLM 标配。
-
25
KV block 环传 + 计算通信重叠:上下文容量随设备数近似线性扩展。
-
26
LongLoRA 补充
S²-Attn 训练省算力、推理保全注意力:拉长上下文的便宜方案。
-
27
YaRN 补充
NTK-aware 插值扩展 RoPE:10 倍 token 效率扩窗,社区实践升格为系统方法。
-
28
U 形注意力:开头结尾记得住、中间找不到——RAG 重排与截断的实证依据。
-
33
Toolformer 主线必读
模型自监督学会调 API:6.7B 零样本超 175B,「外挂能力 > 参数堆砌」的第一次证明。
-
34
WebGPT 必读
RLHF 进 Agent 场景:浏览器问答 + 引用,best-of-n 采样与 test-time compute 的祖先。
-
35
零训练的 Agent 模板:Thought→Action→Observation 循环,LangChain 骨架的来源。
-
36
工业收束:JSON Schema + 开发者可控的工具调用,把学术 hack 变成工程标准。
- 先走主线,再开分支。标「主线必读」的 15 篇构成一条六到八周的核心路径,覆盖全部十个领域的主干概念;各阶段的「必读 / 补充」供你按需深入。
- 三步读法。先读每节的「要点」建立骨架,再读「精读」理解推导与设计动机,最后读「延伸讨论」——那里是真实问答中沉淀下来的批判性思考。
- 顺着连接线读。每篇笔记都标注了与前后论文的呼应:DPO 与 RLHF、Toolformer 与 Function Calling、CLIP 到 LLaVA 再到 BLIP-2。读懂这些连接线,比多读十篇孤立论文更有价值。
- 每阶段收口。读完一个阶段,回到左栏的「阶段目标」自测——能否向别人讲清楚这个领域解决什么问题、代表性方案各自站在哪。