| 1 | Scaling Laws | 损失与N、D、C的幂律关系 |
| 2 | Kaplan vs Chinchilla | compute-optimal配比的核心分歧 |
| 3 | LLaMA创新 | 过训练小模型、开源生态起点 |
| 4 | RoBERTa贡献 | 训练recipe优化、数据量vs架构 |
| 5 | 预训练数据 | 数据质量、去重、配比的重要性 |
答:模型性能(loss)与参数量N、数据量D、计算量C之间存在幂律关系:loss ∝ N^(-α) = D^(-β) = C^(-γ)。实际意义:可以用小规模实验预测大规模训练的效果,指导资源分配;三者存在最优配比,不能只堆参数。
想听:幂律关系 + 资源分配指导,不只是"越大越好"
答:Kaplan建议模型参数优先增长(tokens ∝ N^0.74);Chinchilla修正为近似等比例增长(tokens ∝ N^1.0),即tokens:params ≈ 20:1。Chinchilla证明当时的大模型(GPT-3、Gopher等)普遍训练不足,数据量应该更大。
想听:0.74 vs 1.0的分歧,以及"训练不足"的结论
答:LLaMA验证了"过训练小模型"路线:用比Chinchilla-optimal更多的数据训练较小模型(如7B模型用1T tokens),在推理成本更低的情况下达到更大模型的效果。加上全公开数据+开源权重,直接催生了开源大模型生态。
想听:"过训练小模型"+"开源生态"两个关键词
答:RoBERTa证明BERT"训少了"而非架构差:增加数据量(16GB→160GB)、训练步数(100K→500K)、使用更大batch,性能显著提升。最反直觉的发现是移除NSP任务反而更好,推翻了Devlin原论文的结论。
想听:训练recipe优化 + NSP被推翻
答:N是参数量,D是训练token数,C是总计算量(FLOPs)。6来自:前向传播2N + 反向传播4N(反向是前向的2倍)。所以训练一个N参数、D tokens的模型,总计算量约6ND。
想听:前向2N+反向4N=6N,不只是"经验公式"
| 追问 | 应对要点 |
|---|---|
| "现在还有必要遵循Chinchilla-optimal吗?" | 不一定。Chinchilla优化的是训练成本,但推理成本也很重要。过训练小模型(LLaMA路线)可以降低推理成本,实际部署中可能更划算。 |
| "数据质量和数据量哪个更重要?" | 都重要,但质量是前提。RoBERTa证明数据量重要,但LLaMA论文也强调数据清洗和配比。Gopher/Chinchilla都用了大量数据清洗。 |
| "Scaling Laws还有效吗?GPT-4不公布了参数量。" | 幂律关系仍然有效,但边际收益递减。大厂不公布参数量是商业策略,不代表定律失效。 |
| "LLaMA的RoPE/RMSNorm/SwiGLU是什么?" | 位置编码/归一化/激活函数的具体技术选择,都是当时已有的技术,LLaMA的贡献是验证这些组合在小模型上的有效性。 |
| 场景 | 建议 | 依据 |
|---|---|---|
| 训练预算有限 | 遵循Chinchilla-optimal | 等比例扩展N和D |
| 推理成本敏感 | 过训练小模型 | LLaMA路线,降推理成本 |
| 数据不足 | 优先扩数据而非参数 | 数据质量是天花板 |
| 论文 | 面试关键词 | 关联考点 |
|---|---|---|
| Scaling Laws | 幂律关系 | N/D/C的缩放规律 |
| Chinchilla | compute-optimal | tokens:params≈20:1 |
| LLaMA | 过训练小模型 | 推理成本、开源生态 |
| RoBERTa | 训练recipe | 数据量/步数/batch优化 |