§ 07阶段七 · 检索增强生成 面试指引

检索增强生成(RAG)· 面试高频考点

聚焦:RAG / REALM / Self-RAG / CRAG 的面试高频考点

适用:AI算法岗、大模型应用岗、研究实习面试 | 阅读:10-15分钟

一、高频考点总览

1RAG核心思想检索+生成的结合,参数+非参数记忆
2RAG完整流程Chunking→Embedding→Retrieval→Generation
3REALM检索即预训练的一部分
4Self-RAG自反思检索、反思令牌
5检索质量对生成质量的决定性影响

二、必会问答

Q1: RAG的核心思想是什么?为什么需要RAG?

答:RAG = Retriever(检索器)+ Generator(生成器)。模型参数记忆(parametric memory)有限且不可更新,外部知识库(non-parametric memory)可随时更新。RAG通过检索外部文档来增强生成,解决知识时效性、幻觉、领域适配等问题。

想听:参数记忆局限 + 外部知识增强,不只是"先搜后答"

Q2: RAG的完整流程是什么?每个环节的关键是什么?

答:1)Chunking:文档切分为chunk,关键是chunk大小和重叠;2)Embedding:将chunk向量化,关键是embedding模型质量;3)Retrieval:检索相关chunk,关键是相似度算法(如DPR);4)Generation:将检索结果喂给LLM生成答案,关键是上下文拼接和prompt设计。

想听:四步流程 + 每步的关键点

Q3: REALM和普通RAG有什么区别?

答:普通RAG的Retriever和Generator分开训练,REALM把检索做进预训练本身:用MLM信号端到端训练检索器,让检索器学会"为了填空应该去检索什么"。检索器和生成器联合优化,检索质量更高。

想听:端到端联合训练 vs 分开训练

Q4: Self-RAG的"反思令牌"是什么?有什么作用?

答:Self-RAG在生成时插入特殊token(如[Retrieve]、[IsRel]、[IsSup]、[IsUse]),让模型自己决定:是否需要检索、检索结果是否相关、生成内容是否被支持、答案是否有用。实现了按需检索+自批判,是Agentic RAG的先声。

想听:反思令牌的四个作用 + 按需检索

Q5: 检索质量对生成有什么影响?

答:检索质量是RAG的天花板:检索不到相关文档,生成必然出错;检索到错误文档,生成会被误导(幻觉的来源之一)。Lost in the Middle现象进一步加剧:即使检索到了,关键信息如果在中间位置也可能被忽略。所以RAG的核心在检索,不在生成。

想听:检索是天花板 + Lost in the Middle的启示

三、追问陷阱

追问应对要点
"RAG和Fine-tuning怎么选?"RAG适合知识频繁更新、需要溯源的场景;Fine-tuning适合任务适配、风格统一的场景。两者可以结合:Fine-tuning让模型更会"用"检索结果。
"Chunk大小怎么选?"太小丢失上下文,太大引入噪声。常见256-1024 tokens,需实验验证。还要考虑embedding模型的输入长度限制。
"向量数据库选哪个?"Pinecone/Milvus/Weaviate/Chroma等,各有特点。小规模用Chroma,大规模用Milvus/Pinecone,核心是看是否支持你的向量维度和检索需求。
"RAG的幻觉问题怎么解决?"1)提升检索质量;2)用Self-RAG/CRAG做自我批判;3)要求模型引用来源;4)后处理验证(如检查生成内容与检索文档的一致性)。
"多轮对话的RAG怎么做?"需要维护对话历史的检索上下文:1)将历史对话也纳入检索;2)对每轮对话独立检索再合并;3)用对话摘要做检索。

四、实战建议

RAG方案选型

场景推荐方案理由
简单QA、知识库小基础RAG实现简单,效果够用
知识频繁更新基础RAG外部索引可随时更新
需要高准确率Self-RAG/CRAG自批判提升可靠性
复杂推理+知识RAG+CoT检索+推理结合

面试前速查清单

论文面试关键词关联考点
RAG检索增强生成参数+非参数记忆
REALM预训练检索端到端联合训练
Self-RAG反思令牌按需检索、自批判
CRAG检索质检评估→纠错→精炼