§ 09阶段九 · 多模态 面试指引

多模态(Multimodal)· 面试高频考点

聚焦:CLIP / LLaVA / Stable Diffusion / Flamingo 的面试高频考点

适用:AI算法岗、多模态方向、研究实习面试 | 阅读:10-15分钟

一、高频考点总览

1CLIP对比学习、图文对齐、零样本迁移
2LLaVA视觉语言模型、指令微调
3Stable Diffusion扩散模型、潜在空间生成
4Flamingo交叉注意力、少样本学习
5多模态对齐视觉-语言的统一表示

二、必会问答

Q1: CLIP的核心思想是什么?为什么能实现零样本迁移?

答:CLIP = Contrastive Language-Image Pre-training。用对比学习在4亿图文对上训练,让图像编码器和文本编码器学会对齐。零样本迁移:训练时见过"狗的照片"和"狗"的文本对齐,推理时即使没有标注,也能将新图像与正确文本匹配。

想听:对比学习 + 4亿图文对 + 零样本迁移原理

Q2: LLaVA是怎么把视觉能力接进LLM的?

答:用预训练的CLIP视觉编码器提取图像特征,通过一个投影层映射到LLM的文本表示空间,再和文本token一起输入LLM。训练分两步:1)只训练投影层(特征对齐);2)指令微调整个模型(任务适配)。

想听:CLIP编码器 + 投影层 + 两步训练

Q3: Stable Diffusion为什么在潜在空间做,而不是像素空间?

答:像素空间太大(512×512×3=78万维),扩散过程太慢。Stable Diffusion用VAE先编码到低维潜在空间(如64×64×4=1.6万维),在潜在空间做扩散,速度提升几十倍。U-Net在潜在空间去噪,最后VAE解码回像素。

想听:降维加速 + VAE编码/解码

Q4: Flamingo的交叉注意力是怎么工作的?

答:在冻结的LLM层之间插入交叉注意力层:Q来自文本token,K/V来自视觉特征。这样文本能"看到"图像,同时LLM的主干保持不变。实现了少样本学习:只需几对图文示例,就能学会新任务。

想听:Q来自文本、K/V来自视觉 + 冻结LLM

Q5: 多模态对齐的核心挑战是什么?

答:1)模态鸿沟:视觉和语言是完全不同的表示空间,如何对齐;2)训练数据:高质量的图文配对数据稀缺;3)细粒度对齐:CLIP擅长全局语义,但对细节(如计数、空间关系)较弱;4)推理成本:视觉编码+LLM推理双重开销。

想听:模态鸿沟 + 细粒度对齐 + 推理成本

三、追问陷阱

追问应对要点
"CLIP的对比学习和SimCLR有什么区别?"SimCLR是自监督(图像增强对),CLIP是跨模态监督(图文对)。CLIP用文本做监督信号,更通用。
"LLaVA的投影层是怎么训练的?"第一阶段只训练投影层,用CLIP的图像特征和LLM的文本特征做对比学习,让投影层学会映射。第二阶段再微调整个模型。
"Stable Diffusion的DDIM和DDPM有什么区别?"DDPM需要1000步去噪,DDIM可以跳步(如50步),速度更快,质量相当。实际应用中常用DDIM。
"Flamingo和LLaVA有什么区别?"Flamingo用交叉注意力(视觉在文本中间插入),LLaVA是拼接(视觉在文本前面)。Flamingo更灵活但更复杂,LLaVA更简单但需要对齐。
"CLIP能处理图像生成吗?"不能。CLIP是判别模型(判图文匹配),不是生成模型。但它可以作为生成模型的引导(如CLIP Guidance)。

四、实战建议

多模态方案选型

场景推荐方案理由
图像分类/检索CLIP零样本迁移,无需标注
图像理解+对话LLaVA开源,效果好,易部署
图像生成Stable Diffusion开源,可控,社区活跃
少样本多模态Flamingo少样本学习,但不开源

面试前速查清单

论文面试关键词关联考点
CLIP对比学习零样本迁移、图文对齐
LLaVA视觉语言模型CLIP+LLM、指令微调
Stable Diffusion潜在扩散VAE+U-Net+CLIP文本引导
Flamingo交叉注意力少样本、冻结LLM