§ 03阶段三 · Alignment 面试指引

Alignment(对齐)· 面试高频考点

聚焦:FLAN / InstructGPT / DPO / Constitutional AI / KTO 的面试高频考点

适用:AI算法岗、大模型应用岗、研究实习面试 | 阅读:10-15分钟

一、高频考点总览

1RLHF三步法SFT→RM→PPO每步的作用与必要性
2DPO的简化训RM+RL合并成一步的核心trick
3DPO vs PPO各自适用场景与选型依据
4偏好数据收集成本、标注策略、质量控制
5对齐税能力回退原因与缓解方法

二、必会问答

Q1: RLHF为什么要分三步,不能直接用人类打分训练吗?

答:人类打分有三个问题:1)成本高,无法无限采样;2)一致性差,不同标注者标准不同;3)不可复现。RM学习人类偏好的分布,可无限次、低成本、一致地打分。

想听:理解RM的必要性,不只是"论文这么写的"

Q2: DPO相比RLHF省去了什么?核心trick是什么?

答:省去显式训练RM和PPO在线采样两步。核心trick是重参数化:在BT偏好假设下,最优策略可表示为 βlog(π/π_ref),把奖励隐式编码在策略概率比中,转化为二分类损失。

想听:说出"奖励等价类"或"重参数化",不只是"更简单"

Q3: DPO和PPO在优化方式上有什么本质区别?

答:DPO是offline方法,直接重放离线偏好数据集;PPO是on-policy方法,训练中需要从当前策略采样再用RM打分。DPO更简单稳定,但缺乏在线探索能力。

想听:offline vs on-policy的区别

Q4: 项目中该用DPO还是PPO?

答:有离线偏好数据且任务是单轮生成(对话、摘要)→ 优先DPO;任务需要交互探索、在线环境奖励、或多轮决策 → 考虑PPO。

想听:知道各自适用边界,不是"哪个新用哪个"

Q5: Constitutional AI的创新点是什么?

答:用AI反馈替代人类标注无害性。人类只提供"宪法"(原则),AI自己批评-修订-打分。两阶段:SL(自我批评→修订→SFT)+ RL(AI比较→混合RM→RLAIF)。核心贡献:把人类监督从数万标签压缩到十几条原则。

想听:理解"无害但不回避"的区别

Q6: 什么是对齐税?怎么缓解?

答:对齐税是指RLHF/SFT后模型在某些基准任务上性能回退。缓解:PPO-ptx混合预训练梯度、SFT阶段使用高质量数据、控制对齐强度(β调参)。

想听:知道对齐不是免费的,有trade-off

三、追问陷阱

追问应对要点
"DPO更好,为什么OpenAI还在用PPO?"各有利弊:DPO适合离线场景;PPO的on-policy探索在代码生成、游戏等任务仍不可替代。
"DPO的β怎么调?"大β=保守(接近参考模型),小β=激进(拟合偏好)。需在验证集上实验,无通用最优值。
"偏好数据怎么保证质量?"标注者一致性、数据清洗、多轮审核、CrowdAI+专家混合。InstructGPT标注者一致率约73%。
"KL散度约束是必须的吗?"是。没有KL约束会reward hacking,生成RM高分但人类无意义的内容。
"RLAIF和RLHF有什么区别?"RL阶段相同,区别在harmlessness标签来源:RLHF用人类,RLAIF用AI。helpfulness仍需人类标签。

四、实战建议

项目中如何选择对齐方法?

场景推荐理由
对话产品(单轮)DPO简单稳定,离线偏好数据够用
代码生成PPO+单元测试奖励需在线探索,测试用例可作奖励信号
安全对齐CAI/RLAIF无害性标注成本高,AI反馈可扩展
资源受限DPO无需训RM,显存和算力需求更低

面试前速查清单

论文面试关键词关联考点
FLAN指令微调开山SFT必要性、zero-shot泛化
InstructGPTRLHF三步法SFT→RM→PPO完整流程
DPO直接偏好优化重参数化、二分类损失
Constitutional AIRLAIFAI反馈替代人类标注
KTO单边偏好无需成对数据的对齐