欢迎光临
我们一直在努力

Qwen2.5-VL 家族模型技术解析


目录

  • 概述
  • 模型家族一览
  • 模型架构
  • 核心特性与能力
  • 训练数据
  • 基准测试与性能
  • 相比 Qwen2-VL 的改进
  • 快速上手
  • 应用场景

  • 1. 概述

    Qwen2.5-VL 是由阿里巴巴 Qwen 团队开发的新一代多模态视觉语言模型(Vision-Language Model),于 2025年1月底 正式发布,是 Qwen 系列视觉语言模型的旗舰版本。该模型在前代 Qwen2-VL 的基础上实现了重大飞跃,在视觉识别、精确目标定位、文档解析、视频理解和智能体交互等方面展现了卓越能力。

    Qwen2.5-VL 采用 Apache 2.0 开源协议发布(32B 版本),模型权重及代码均可在 Hugging Face 和 ModelScope 平台获取。

    关键数字:

    • 预训练 Token 数量:4.1 万亿(4.1T)(相比前代 1.2T 提升约 3.4 倍)
    • 模型规格:3B、7B、32B、72B 四种参数规模
    • 发布形式:每种规格均包含 Base 和 Instruct 版本

    2. 模型家族一览

    Qwen2.5-VL 家族目前包含以下模型,覆盖从边缘设备到高性能计算的完整场景:

    2.1 模型规格对照表

    模型名称
    参数量
    LLM 层数
    注意力头数
    KV 头数
    隐藏层维度
    ViT 参数量
    定位方式
    开源协议
    Qwen2.5-VL-3B 3.75B 36 16 2 2048 ~675M 边缘 AI / 移动端 Apache 2.0
    Qwen2.5-VL-7B 8.29B 28 28 4 3584 ~675M 通用推理 Apache 2.0
    Qwen2.5-VL-32B ~32B ~675M 强化学习优化版 Apache 2.0
    Qwen2.5-VL-72B 73.4B 80 64 8 8192 ~675M 旗舰级 自定义

    注:32B 模型于 2025 年 3 月发布,通过强化学习进一步优化,在多项任务上超越了前代 72B 模型。

    2.2 各版本 Hugging Face 模型 ID

    模型规格
    Base 模型
    Instruct 模型
    AWQ 量化版
    3B Qwen/Qwen2.5-VL-3B Qwen/Qwen2.5-VL-3B-Instruct Qwen/Qwen2.5-VL-3B-Instruct-AWQ
    7B Qwen/Qwen2.5-VL-7B Qwen/Qwen2.5-VL-7B-Instruct Qwen/Qwen2.5-VL-7B-Instruct-AWQ
    32B Qwen/Qwen2.5-VL-32B-Instruct
    72B Qwen/Qwen2.5-VL-72B Qwen/Qwen2.5-VL-72B-Instruct Qwen/Qwen2.5-VL-72B-Instruct-AWQ

    3. 模型架构

    Qwen2.5-VL 采用经典的 编码器-融合器-解码器 架构,由三个核心组件构成:

    3.1 整体架构

    输入(图像/视频/文本)

    ├── 视觉输入 ──► Vision Encoder (ViT) ──► MLP Vision-Language Merger ──┐
    │ │
    └── 文本输入 ──► Tokenizer ──► Text Embeddings ─────────────────────────┤


    Large Language Model (LLM)


    文本输出

    3.2 视觉编码器(Vision Encoder)

    Qwen2.5-VL 的视觉编码器是一个 重新设计的 Vision Transformer(ViT),具有以下核心特征:

    • 原生动态分辨率:从头开始训练,支持不同分辨率输入,图像的高和宽被调整为 28 的倍数,以步长 14 生成图像 Patch
    • 2D-RoPE / 3D-RoPE:引入二维/三维旋转位置编码,分别用于图像的空间位置和视频的时空位置
    • 窗口注意力(Window Attention):ViT 中仅 4 层 使用全注意力(Full Attention),其余均使用窗口注意力,最大窗口大小为 8×8
    • 架构对齐:ViT 采用与 LLM 一致的 RMSNorm 和 SwiGLU 结构,简化整体网络
    • 参数量:约 6.75 亿(675M) 参数

    训练阶段:视觉编码器经历了 CLIP 预训练 → 视觉语言对齐 → 端到端训练三个阶段。

    3.3 视觉语言融合器(MLP-based Vision-Language Merger)

    采用基于 MLP 的视觉语言融合器来压缩视觉特征序列:

  • 将空间相邻的 Patch 特征进行分组
  • 拼接(Concatenate)分组后的特征
  • 通过 两层 MLP 投影到与 LLM 文本嵌入对齐的维度
  • 该设计有效解决了长图像特征序列带来的效率问题。

    3.4 大语言模型(LLM)

    • LLM 骨干使用 Qwen2.5 LLM 的预训练权重初始化
    • 将原始的 1D RoPE 替换为 多模态旋转位置编码(MRoPE),并与绝对时间对齐
    • 支持最大位置编码长度 32,768 tokens
    • 使用 Grouped Query Attention(GQA) 提升推理效率

    3.5 多模态旋转位置编码(MRoPE)

    MRoPE 是 Qwen2.5-VL 的关键创新之一,它将位置编码扩展到三个维度:

    维度
    赞(0)
    未经允许不得转载:171主机测评 » Qwen2.5-VL 家族模型技术解析
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址