欢迎光临
我们一直在努力

多模态大模型架构(CLIP, Flamingo)(分层式精讲)

多模态大模型架构分层式精讲:CLIP 与 Flamingo

在这里插入图片描述

核心结论:CLIP 解决“图像和文本如何对齐”,Flamingo 解决“如何把视觉信息接入语言模型并生成答案”。前者更像检索和分类底座,后者更像生成式视觉语言模型。两者都重要,但能力边界不同,不能简单归为“会看图聊天”。

在这里插入图片描述

第 0 层:30 秒理解

本文聚焦视觉-语言模型。更广义的多模态还包括音频、视频、3D、传感器等,但 CLIP 和 Flamingo 的核心代表的是图像-文本路线。

模型
一句话理解
输入
输出
典型用途
CLIP 双塔模型,把图片和文字映射到同一语义空间 图像、候选文本 相似度分数 图文检索、零样本分类、数据过
赞(0)
未经允许不得转载:171主机测评 » 多模态大模型架构(CLIP, Flamingo)(分层式精讲)
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址