基础概念18
不给示例直接做题(zero),或在 prompt 里给几个示例再做题(few);示例只进上下文,不更新参数。 §03 §08
不需要人工标注,从数据自身构造监督信号(预测下一个词、补全被 mask 的词);预训练与 Toolformer 数据生产的基本盘。 §33 §03
只用一半 Transformer 的两种架构:encoder-only 双向理解(BERT 系),decoder-only 自回归生成(GPT 系,今天主流 LLM 的选择)。 §03 §02
训练与对齐15
推理9
推理阶段多花算力换答案质量(多次采样、搜索、验证);ToT、best-of-n 与 o1/R1 的共同思想。 §15 §34
给解答打正确性分的判别模型;细到每个推理步骤的是过程奖励模型(PRM),GSM8K 是这条路线的起点。 §43
模型自己生成解答 → 按对错筛选 → 回炉再训,用「自己的输出训练自己」;STaR 的过滤判据是答案对错,Toolformer 换成了损失下降。 §17 §33
同一道题独立采样 n 条,用奖励模型挑最好的一条;比跑 RL 便宜且常更有效,test-time compute 的祖先。 §34
效率9
隐藏状态里少数「数值特别大又特别关键」的特征维度,约 6.7B 规模起系统性出现,是量化掉点的元凶;LLM.int8() 把它们单独留在 16-bit。 §21
长上下文8
RAG5
先从外部语料检索相关文档、拼进上下文再生成;知识可更新、可溯源,覆盖 Chunking → Embedding → Retrieval → Generation 全链路。 §29
RAG 的两件套:负责「找」的检索器(双塔编码 + 向量索引)和负责「写」的生成器;RAG 论文主张联合微调。 §29
用向量内积找最相似文档(稠密检索),FAISS 等索引做最大内积搜索加速;REALM 让检索器在预训练中被端到端训出来。 §30
Agent3
多模态5
用 GPT-4 生成的图文指令数据微调,让 LLM 学会「看着图听话」;LLaVA 的命名权贡献,连接件只是一个线性层。 §37