§ 02阶段二 · Pre-training 与 Scaling Law 面试指引

Pre-training与Scaling Law · 面试高频考点

聚焦:Scaling Laws / Chinchilla / LLaMA / RoBERTa 的面试高频考点

适用:AI算法岗、大模型应用岗、研究实习面试 | 阅读:10-15分钟

一、高频考点总览

1Scaling Laws损失与N、D、C的幂律关系
2Kaplan vs Chinchillacompute-optimal配比的核心分歧
3LLaMA创新过训练小模型、开源生态起点
4RoBERTa贡献训练recipe优化、数据量vs架构
5预训练数据数据质量、去重、配比的重要性

二、必会问答

Q1: Scaling Laws的核心发现是什么?有什么实际意义?

答:模型性能(loss)与参数量N、数据量D、计算量C之间存在幂律关系:loss ∝ N^(-α) = D^(-β) = C^(-γ)。实际意义:可以用小规模实验预测大规模训练的效果,指导资源分配;三者存在最优配比,不能只堆参数。

想听:幂律关系 + 资源分配指导,不只是"越大越好"

Q2: Kaplan和Chinchilla在compute-optimal配比上的核心分歧是什么?

答:Kaplan建议模型参数优先增长(tokens ∝ N^0.74);Chinchilla修正为近似等比例增长(tokens ∝ N^1.0),即tokens:params ≈ 20:1。Chinchilla证明当时的大模型(GPT-3、Gopher等)普遍训练不足,数据量应该更大。

想听:0.74 vs 1.0的分歧,以及"训练不足"的结论

Q3: LLaMA的核心创新是什么?为什么说它重要?

答:LLaMA验证了"过训练小模型"路线:用比Chinchilla-optimal更多的数据训练较小模型(如7B模型用1T tokens),在推理成本更低的情况下达到更大模型的效果。加上全公开数据+开源权重,直接催生了开源大模型生态。

想听:"过训练小模型"+"开源生态"两个关键词

Q4: RoBERTa的贡献是什么?它推翻了BERT的哪个结论?

答:RoBERTa证明BERT"训少了"而非架构差:增加数据量(16GB→160GB)、训练步数(100K→500K)、使用更大batch,性能显著提升。最反直觉的发现是移除NSP任务反而更好,推翻了Devlin原论文的结论。

想听:训练recipe优化 + NSP被推翻

Q5: C ≈ 6ND这个公式是什么意思?6是怎么来的?

答:N是参数量,D是训练token数,C是总计算量(FLOPs)。6来自:前向传播2N + 反向传播4N(反向是前向的2倍)。所以训练一个N参数、D tokens的模型,总计算量约6ND。

想听:前向2N+反向4N=6N,不只是"经验公式"

三、追问陷阱

追问应对要点
"现在还有必要遵循Chinchilla-optimal吗?"不一定。Chinchilla优化的是训练成本,但推理成本也很重要。过训练小模型(LLaMA路线)可以降低推理成本,实际部署中可能更划算。
"数据质量和数据量哪个更重要?"都重要,但质量是前提。RoBERTa证明数据量重要,但LLaMA论文也强调数据清洗和配比。Gopher/Chinchilla都用了大量数据清洗。
"Scaling Laws还有效吗?GPT-4不公布了参数量。"幂律关系仍然有效,但边际收益递减。大厂不公布参数量是商业策略,不代表定律失效。
"LLaMA的RoPE/RMSNorm/SwiGLU是什么?"位置编码/归一化/激活函数的具体技术选择,都是当时已有的技术,LLaMA的贡献是验证这些组合在小模型上的有效性。

四、实战建议

训练决策速查

场景建议依据
训练预算有限遵循Chinchilla-optimal等比例扩展N和D
推理成本敏感过训练小模型LLaMA路线,降推理成本
数据不足优先扩数据而非参数数据质量是天花板

面试前速查清单

论文面试关键词关联考点
Scaling Laws幂律关系N/D/C的缩放规律
Chinchillacompute-optimaltokens:params≈20:1
LLaMA过训练小模型推理成本、开源生态
RoBERTa训练recipe数据量/步数/batch优化