| 1 | CLIP | 对比学习、图文对齐、零样本迁移 |
| 2 | LLaVA | 视觉语言模型、指令微调 |
| 3 | Stable Diffusion | 扩散模型、潜在空间生成 |
| 4 | Flamingo | 交叉注意力、少样本学习 |
| 5 | 多模态对齐 | 视觉-语言的统一表示 |
答:CLIP = Contrastive Language-Image Pre-training。用对比学习在4亿图文对上训练,让图像编码器和文本编码器学会对齐。零样本迁移:训练时见过"狗的照片"和"狗"的文本对齐,推理时即使没有标注,也能将新图像与正确文本匹配。
想听:对比学习 + 4亿图文对 + 零样本迁移原理
答:用预训练的CLIP视觉编码器提取图像特征,通过一个投影层映射到LLM的文本表示空间,再和文本token一起输入LLM。训练分两步:1)只训练投影层(特征对齐);2)指令微调整个模型(任务适配)。
想听:CLIP编码器 + 投影层 + 两步训练
答:像素空间太大(512×512×3=78万维),扩散过程太慢。Stable Diffusion用VAE先编码到低维潜在空间(如64×64×4=1.6万维),在潜在空间做扩散,速度提升几十倍。U-Net在潜在空间去噪,最后VAE解码回像素。
想听:降维加速 + VAE编码/解码
答:在冻结的LLM层之间插入交叉注意力层:Q来自文本token,K/V来自视觉特征。这样文本能"看到"图像,同时LLM的主干保持不变。实现了少样本学习:只需几对图文示例,就能学会新任务。
想听:Q来自文本、K/V来自视觉 + 冻结LLM
答:1)模态鸿沟:视觉和语言是完全不同的表示空间,如何对齐;2)训练数据:高质量的图文配对数据稀缺;3)细粒度对齐:CLIP擅长全局语义,但对细节(如计数、空间关系)较弱;4)推理成本:视觉编码+LLM推理双重开销。
想听:模态鸿沟 + 细粒度对齐 + 推理成本
| 追问 | 应对要点 |
|---|---|
| "CLIP的对比学习和SimCLR有什么区别?" | SimCLR是自监督(图像增强对),CLIP是跨模态监督(图文对)。CLIP用文本做监督信号,更通用。 |
| "LLaVA的投影层是怎么训练的?" | 第一阶段只训练投影层,用CLIP的图像特征和LLM的文本特征做对比学习,让投影层学会映射。第二阶段再微调整个模型。 |
| "Stable Diffusion的DDIM和DDPM有什么区别?" | DDPM需要1000步去噪,DDIM可以跳步(如50步),速度更快,质量相当。实际应用中常用DDIM。 |
| "Flamingo和LLaVA有什么区别?" | Flamingo用交叉注意力(视觉在文本中间插入),LLaVA是拼接(视觉在文本前面)。Flamingo更灵活但更复杂,LLaVA更简单但需要对齐。 |
| "CLIP能处理图像生成吗?" | 不能。CLIP是判别模型(判图文匹配),不是生成模型。但它可以作为生成模型的引导(如CLIP Guidance)。 |
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 图像分类/检索 | CLIP | 零样本迁移,无需标注 |
| 图像理解+对话 | LLaVA | 开源,效果好,易部署 |
| 图像生成 | Stable Diffusion | 开源,可控,社区活跃 |
| 少样本多模态 | Flamingo | 少样本学习,但不开源 |
| 论文 | 面试关键词 | 关联考点 |
|---|---|---|
| CLIP | 对比学习 | 零样本迁移、图文对齐 |
| LLaVA | 视觉语言模型 | CLIP+LLM、指令微调 |
| Stable Diffusion | 潜在扩散 | VAE+U-Net+CLIP文本引导 |
| Flamingo | 交叉注意力 | 少样本、冻结LLM |