| 1 | Transformer核心创新 | 为什么不用RNN/CNN,只用Attention |
| 2 | Self-Attention机制 | Q/K/V计算、多头注意力的作用 |
| 3 | 位置编码 | 为什么需要,正弦编码的特性 |
| 4 | BERT vs GPT | encoder-only vs decoder-only的区别与适用场景 |
| 5 | 预训练-微调范式 | MLM、NSP、zero-shot/few-shot/fine-tuning三种范式 |
答:RNN固有顺序性,无法并行,训练效率低;且长距离依赖要逐步传递,信息衰减。Transformer用Self-Attention替代循环,任意两个位置直接连接,路径长度为常数,且完全可并行。训练速度和长距离依赖建模都显著优于RNN。
想听:顺序瓶颈 vs 并行优势,不只是"Attention更好"
答:Q(Query)、K(Key)、V(Value)是三个线性投影,Q和K计算注意力权重,V是被加权的内容。Attention(Q,K,V)=softmax(QK^T/√d_k)V。除以√d_k是防止点积过大导致softmax梯度消失(进入饱和区),保持梯度稳定。
想听:不只是"缩放",要说出防止梯度消失的原因
答:单头注意力只能关注一种关系模式。多头让模型同时关注不同位置的不同表示子空间(如语法关系、语义关系、位置关系等)。每个head独立计算attention再拼接,相当于多组并行的"注意力专家"。
想听:不同子空间/不同关系模式,不只是"效果更好"
答:BERT是encoder-only,双向注意力,适合理解任务(分类、QA、匹配);GPT是decoder-only,单向(从左到右)注意力,适合生成任务(文本生成、续写)。BERT用MLM预训练,GPT用自回归语言模型预训练。最终GPT系证明"会生成的也能理解",decoder-only统一天下。
想听:双向 vs 单向的本质区别,不只是"BERT理解、GPT生成"
答:MLM(Masked Language Model)随机遮盖15%的token让模型预测,迫使模型学习双向上下文。NSP(Next Sentence Prediction)预测两个句子是否相邻,试图捕获句间关系。但后续RoBERTa论文证明移除NSP反而更好,说明NSP任务设计不够有效。
想听:知道NSP被RoBERTa推翻的反转
答:先在大规模无标注语料上预训练一个通用模型(学语言知识),再在下游任务的有标注数据上微调(学任务适配)。此前每个任务都要从头训练,BERT证明"预训练一次、处处微调"可行,大幅降低数据和算力门槛,成为NLP标准范式。
想听:从"每个任务从头训"到"预训练+微调"的范式转变
| 追问 | 应对要点 |
|---|---|
| "Transformer的注意力复杂度是多少?有什么问题?" | O(n²·d),n是序列长度。长序列计算和内存开销大,催生了阶段六的长上下文技术(RoPE、Ring Attention等)。 |
| "为什么GPT不用交叉注意力?" | GPT是decoder-only,输入和输出在同一序列中,用causal mask的self-attention即可。交叉注意力用于encoder-decoder架构中decoder关注encoder输出。 |
| "BERT的MLM mask策略是什么?为什么是80/10/10?" | 被mask的token:80%替换为[MASK]、10%替换为随机token、10%保持不变。防止模型只学会处理[MASK]标记,提升泛化能力。 |
| "位置编码为什么用正弦函数?能学到吗?" | 正弦编码使模型能学到相对位置关系(通过线性变换),且有一定外推能力。但实际证明正弦编码外推能力有限,后续有RoPE等改进。 |
| "为什么说GPT-2是'无监督多任务学习'?" | GPT-2通过自回归预测下一个词,在这个过程中隐式学到了翻译、摘要、QA等多种任务能力,无需针对每个任务单独训练。 |
| 任务类型 | 推荐架构 | 代表模型 |
|---|---|---|
| 文本分类、NER、QA | Encoder-only | BERT、RoBERTa |
| 文本生成、续写 | Decoder-only | GPT系列、LLaMA |
| 翻译、摘要(seq2seq) | Encoder-Decoder | T5、BART |
| 论文 | 面试关键词 | 关联考点 |
|---|---|---|
| Attention Is All You Need | Transformer开山 | Self-Attention、多头、位置编码 |
| BERT | 双向编码器 | MLM、NSP、预训练-微调范式 |
| GPT-2 | Decoder-only | 自回归、zero-shot、无监督多任务 |