目录
1. 概述
Qwen2.5-VL 是由阿里巴巴 Qwen 团队开发的新一代多模态视觉语言模型(Vision-Language Model),于 2025年1月底 正式发布,是 Qwen 系列视觉语言模型的旗舰版本。该模型在前代 Qwen2-VL 的基础上实现了重大飞跃,在视觉识别、精确目标定位、文档解析、视频理解和智能体交互等方面展现了卓越能力。
Qwen2.5-VL 采用 Apache 2.0 开源协议发布(32B 版本),模型权重及代码均可在 Hugging Face 和 ModelScope 平台获取。
关键数字:
- 预训练 Token 数量:4.1 万亿(4.1T)(相比前代 1.2T 提升约 3.4 倍)
- 模型规格:3B、7B、32B、72B 四种参数规模
- 发布形式:每种规格均包含 Base 和 Instruct 版本
2. 模型家族一览
Qwen2.5-VL 家族目前包含以下模型,覆盖从边缘设备到高性能计算的完整场景:
2.1 模型规格对照表
| Qwen2.5-VL-3B | 3.75B | 36 | 16 | 2 | 2048 | ~675M | 边缘 AI / 移动端 | Apache 2.0 |
| Qwen2.5-VL-7B | 8.29B | 28 | 28 | 4 | 3584 | ~675M | 通用推理 | Apache 2.0 |
| Qwen2.5-VL-32B | ~32B | – | – | – | – | ~675M | 强化学习优化版 | Apache 2.0 |
| Qwen2.5-VL-72B | 73.4B | 80 | 64 | 8 | 8192 | ~675M | 旗舰级 | 自定义 |
注:32B 模型于 2025 年 3 月发布,通过强化学习进一步优化,在多项任务上超越了前代 72B 模型。
2.2 各版本 Hugging Face 模型 ID
| 3B | Qwen/Qwen2.5-VL-3B | Qwen/Qwen2.5-VL-3B-Instruct | Qwen/Qwen2.5-VL-3B-Instruct-AWQ |
| 7B | Qwen/Qwen2.5-VL-7B | Qwen/Qwen2.5-VL-7B-Instruct | Qwen/Qwen2.5-VL-7B-Instruct-AWQ |
| 32B | – | Qwen/Qwen2.5-VL-32B-Instruct | – |
| 72B | Qwen/Qwen2.5-VL-72B | Qwen/Qwen2.5-VL-72B-Instruct | Qwen/Qwen2.5-VL-72B-Instruct-AWQ |
3. 模型架构
Qwen2.5-VL 采用经典的 编码器-融合器-解码器 架构,由三个核心组件构成:
3.1 整体架构
输入(图像/视频/文本)
│
├── 视觉输入 ──► Vision Encoder (ViT) ──► MLP Vision-Language Merger ──┐
│ │
└── 文本输入 ──► Tokenizer ──► Text Embeddings ─────────────────────────┤
│
▼
Large Language Model (LLM)
│
▼
文本输出
3.2 视觉编码器(Vision Encoder)
Qwen2.5-VL 的视觉编码器是一个 重新设计的 Vision Transformer(ViT),具有以下核心特征:
- 原生动态分辨率:从头开始训练,支持不同分辨率输入,图像的高和宽被调整为 28 的倍数,以步长 14 生成图像 Patch
- 2D-RoPE / 3D-RoPE:引入二维/三维旋转位置编码,分别用于图像的空间位置和视频的时空位置
- 窗口注意力(Window Attention):ViT 中仅 4 层 使用全注意力(Full Attention),其余均使用窗口注意力,最大窗口大小为 8×8
- 架构对齐:ViT 采用与 LLM 一致的 RMSNorm 和 SwiGLU 结构,简化整体网络
- 参数量:约 6.75 亿(675M) 参数
训练阶段:视觉编码器经历了 CLIP 预训练 → 视觉语言对齐 → 端到端训练三个阶段。
3.3 视觉语言融合器(MLP-based Vision-Language Merger)
采用基于 MLP 的视觉语言融合器来压缩视觉特征序列:
该设计有效解决了长图像特征序列带来的效率问题。
3.4 大语言模型(LLM)
- LLM 骨干使用 Qwen2.5 LLM 的预训练权重初始化
- 将原始的 1D RoPE 替换为 多模态旋转位置编码(MRoPE),并与绝对时间对齐
- 支持最大位置编码长度 32,768 tokens
- 使用 Grouped Query Attention(GQA) 提升推理效率
3.5 多模态旋转位置编码(MRoPE)
MRoPE 是 Qwen2.5-VL 的关键创新之一,它将位置编码扩展到三个维度:






