| 1 | RLHF三步法 | SFT→RM→PPO每步的作用与必要性 |
| 2 | DPO的简化 | 训RM+RL合并成一步的核心trick |
| 3 | DPO vs PPO | 各自适用场景与选型依据 |
| 4 | 偏好数据 | 收集成本、标注策略、质量控制 |
| 5 | 对齐税 | 能力回退原因与缓解方法 |
答:人类打分有三个问题:1)成本高,无法无限采样;2)一致性差,不同标注者标准不同;3)不可复现。RM学习人类偏好的分布,可无限次、低成本、一致地打分。
想听:理解RM的必要性,不只是"论文这么写的"
答:省去显式训练RM和PPO在线采样两步。核心trick是重参数化:在BT偏好假设下,最优策略可表示为 βlog(π/π_ref),把奖励隐式编码在策略概率比中,转化为二分类损失。
想听:说出"奖励等价类"或"重参数化",不只是"更简单"
答:DPO是offline方法,直接重放离线偏好数据集;PPO是on-policy方法,训练中需要从当前策略采样再用RM打分。DPO更简单稳定,但缺乏在线探索能力。
想听:offline vs on-policy的区别
答:有离线偏好数据且任务是单轮生成(对话、摘要)→ 优先DPO;任务需要交互探索、在线环境奖励、或多轮决策 → 考虑PPO。
想听:知道各自适用边界,不是"哪个新用哪个"
答:用AI反馈替代人类标注无害性。人类只提供"宪法"(原则),AI自己批评-修订-打分。两阶段:SL(自我批评→修订→SFT)+ RL(AI比较→混合RM→RLAIF)。核心贡献:把人类监督从数万标签压缩到十几条原则。
想听:理解"无害但不回避"的区别
答:对齐税是指RLHF/SFT后模型在某些基准任务上性能回退。缓解:PPO-ptx混合预训练梯度、SFT阶段使用高质量数据、控制对齐强度(β调参)。
想听:知道对齐不是免费的,有trade-off
| 追问 | 应对要点 |
|---|---|
| "DPO更好,为什么OpenAI还在用PPO?" | 各有利弊:DPO适合离线场景;PPO的on-policy探索在代码生成、游戏等任务仍不可替代。 |
| "DPO的β怎么调?" | 大β=保守(接近参考模型),小β=激进(拟合偏好)。需在验证集上实验,无通用最优值。 |
| "偏好数据怎么保证质量?" | 标注者一致性、数据清洗、多轮审核、CrowdAI+专家混合。InstructGPT标注者一致率约73%。 |
| "KL散度约束是必须的吗?" | 是。没有KL约束会reward hacking,生成RM高分但人类无意义的内容。 |
| "RLAIF和RLHF有什么区别?" | RL阶段相同,区别在harmlessness标签来源:RLHF用人类,RLAIF用AI。helpfulness仍需人类标签。 |
| 场景 | 推荐 | 理由 |
|---|---|---|
| 对话产品(单轮) | DPO | 简单稳定,离线偏好数据够用 |
| 代码生成 | PPO+单元测试奖励 | 需在线探索,测试用例可作奖励信号 |
| 安全对齐 | CAI/RLAIF | 无害性标注成本高,AI反馈可扩展 |
| 资源受限 | DPO | 无需训RM,显存和算力需求更低 |
| 论文 | 面试关键词 | 关联考点 |
|---|---|---|
| FLAN | 指令微调开山 | SFT必要性、zero-shot泛化 |
| InstructGPT | RLHF三步法 | SFT→RM→PPO完整流程 |
| DPO | 直接偏好优化 | 重参数化、二分类损失 |
| Constitutional AI | RLAIF | AI反馈替代人类标注 |
| KTO | 单边偏好 | 无需成对数据的对齐 |