§ 01阶段一 · Transformer 架构 面试指引

Transformer架构 · 面试高频考点

聚焦:Attention Is All You Need / BERT / GPT-2 的面试高频考点

适用:AI算法岗、大模型应用岗、研究实习面试 | 阅读:10-15分钟

一、高频考点总览

1Transformer核心创新为什么不用RNN/CNN,只用Attention
2Self-Attention机制Q/K/V计算、多头注意力的作用
3位置编码为什么需要,正弦编码的特性
4BERT vs GPTencoder-only vs decoder-only的区别与适用场景
5预训练-微调范式MLM、NSP、zero-shot/few-shot/fine-tuning三种范式

二、必会问答

Q1: Transformer为什么能取代RNN?核心优势是什么?

答:RNN固有顺序性,无法并行,训练效率低;且长距离依赖要逐步传递,信息衰减。Transformer用Self-Attention替代循环,任意两个位置直接连接,路径长度为常数,且完全可并行。训练速度和长距离依赖建模都显著优于RNN。

想听:顺序瓶颈 vs 并行优势,不只是"Attention更好"

Q2: Self-Attention的Q/K/V是什么?为什么要除以√d_k?

答:Q(Query)、K(Key)、V(Value)是三个线性投影,Q和K计算注意力权重,V是被加权的内容。Attention(Q,K,V)=softmax(QK^T/√d_k)V。除以√d_k是防止点积过大导致softmax梯度消失(进入饱和区),保持梯度稳定。

想听:不只是"缩放",要说出防止梯度消失的原因

Q3: 多头注意力的作用是什么?为什么不只用一个头?

答:单头注意力只能关注一种关系模式。多头让模型同时关注不同位置的不同表示子空间(如语法关系、语义关系、位置关系等)。每个head独立计算attention再拼接,相当于多组并行的"注意力专家"。

想听:不同子空间/不同关系模式,不只是"效果更好"

Q4: BERT和GPT的核心区别是什么?各自适合什么任务?

答:BERT是encoder-only,双向注意力,适合理解任务(分类、QA、匹配);GPT是decoder-only,单向(从左到右)注意力,适合生成任务(文本生成、续写)。BERT用MLM预训练,GPT用自回归语言模型预训练。最终GPT系证明"会生成的也能理解",decoder-only统一天下。

想听:双向 vs 单向的本质区别,不只是"BERT理解、GPT生成"

Q5: BERT的MLM和NSP分别是什么?NSP有用吗?

答:MLM(Masked Language Model)随机遮盖15%的token让模型预测,迫使模型学习双向上下文。NSP(Next Sentence Prediction)预测两个句子是否相邻,试图捕获句间关系。但后续RoBERTa论文证明移除NSP反而更好,说明NSP任务设计不够有效。

想听:知道NSP被RoBERTa推翻的反转

Q6: 什么是"预训练-微调"范式?为什么它改变了NLP?

答:先在大规模无标注语料上预训练一个通用模型(学语言知识),再在下游任务的有标注数据上微调(学任务适配)。此前每个任务都要从头训练,BERT证明"预训练一次、处处微调"可行,大幅降低数据和算力门槛,成为NLP标准范式。

想听:从"每个任务从头训"到"预训练+微调"的范式转变

三、追问陷阱

追问应对要点
"Transformer的注意力复杂度是多少?有什么问题?"O(n²·d),n是序列长度。长序列计算和内存开销大,催生了阶段六的长上下文技术(RoPE、Ring Attention等)。
"为什么GPT不用交叉注意力?"GPT是decoder-only,输入和输出在同一序列中,用causal mask的self-attention即可。交叉注意力用于encoder-decoder架构中decoder关注encoder输出。
"BERT的MLM mask策略是什么?为什么是80/10/10?"被mask的token:80%替换为[MASK]、10%替换为随机token、10%保持不变。防止模型只学会处理[MASK]标记,提升泛化能力。
"位置编码为什么用正弦函数?能学到吗?"正弦编码使模型能学到相对位置关系(通过线性变换),且有一定外推能力。但实际证明正弦编码外推能力有限,后续有RoPE等改进。
"为什么说GPT-2是'无监督多任务学习'?"GPT-2通过自回归预测下一个词,在这个过程中隐式学到了翻译、摘要、QA等多种任务能力,无需针对每个任务单独训练。

四、实战建议

架构选型速查

任务类型推荐架构代表模型
文本分类、NER、QAEncoder-onlyBERT、RoBERTa
文本生成、续写Decoder-onlyGPT系列、LLaMA
翻译、摘要(seq2seq)Encoder-DecoderT5、BART

面试前速查清单

论文面试关键词关联考点
Attention Is All You NeedTransformer开山Self-Attention、多头、位置编码
BERT双向编码器MLM、NSP、预训练-微调范式
GPT-2Decoder-only自回归、zero-shot、无监督多任务