多模态大模型架构分层式精讲:CLIP 与 Flamingo

核心结论:CLIP 解决“图像和文本如何对齐”,Flamingo 解决“如何把视觉信息接入语言模型并生成答案”。前者更像检索和分类底座,后者更像生成式视觉语言模型。两者都重要,但能力边界不同,不能简单归为“会看图聊天”。

第 0 层:30 秒理解
本文聚焦视觉-语言模型。更广义的多模态还包括音频、视频、3D、传感器等,但 CLIP 和 Flamingo 的核心代表的是图像-文本路线。
| CLIP | 双塔模型,把图片和文字映射到同一语义空间 | 图像、候选文本 | 相似度分数 | 图文检索、零样本分类、数据过 |



