Qwen2.5-VL 是通义千问团队的视觉语言模型(VLM)系列,2025 年 1 月 28 日发布并开源,被视为开源多模态模型的标杆之作——它不仅「看图说话」,还能解析文档、操作电脑、在图上精准定位。2025 年下半年,下一代 Qwen3-VL 接续发布。本文合并 Qwen 官方博客与 Qwen-VL 官方 GitHub README,完整梳理这两代模型。

一、Qwen2.5-VL 三大核心能力
据官方发布博客,Qwen2.5-VL 的能力覆盖三大方向:
1. 文档解析
从单纯的 OCR 升级到全解析:输出文本内容的同时保留布局位置信息(坐标、表格结构),并支持 Qwen HTML 格式输出。官方描述其能处理多场景、多语言、多样式的手写与印刷文档,在 DocVQA 等文档理解基准上达到 SOTA。

2. Agent 操作
Qwen2.5-VL 是首个在此代引入视觉 Agent 能力的开源模型:能对手机与电脑 GUI 进行长程规划、精准定位 UI 元素并逐步执行操作,在 MSAgent-Bench 等移动 Agent 基准上成绩领先,可自动完成订票、点外卖等端到端任务。
3. 视觉定位
支持绝对坐标与相对坐标两套定位体系:既能输出图中文本的精确边界框,也能用「左上/右下」等相对语言描述区域;点击定位支持单点、多点、规则网格等多种形式。

二、模型家族与显存需求
Qwen2.5-VL 提供 3B、7B、32B、72B 四个尺寸;2025 年 2 月 20 日发布技术报告(arXiv:2502.13923)的同时发布了 3B/7B/72B 三个尺寸的 AWQ 量化版。官方 README 附表给出了 transformers 推理的理论最小显存需求:
| 精度 | Qwen2.5-VL-3B | Qwen2.5-VL-7B | Qwen2.5-VL-72B |
|---|---|---|---|
| FP32 | 11.5 GB | 26.34 GB | 266.21 GB |
| BF16 | 5.75 GB | 13.17 GB | 133.11 GB |
| INT8 | 2.87 GB | 6.59 GB | 66.5 GB |
| INT4 | 1.44 GB | 3.29 GB | 33.28 GB |
官方注:「实际显存占用通常至少是理论值的 1.2 倍。」
三、架构基础
Qwen2.5-VL 的两个关键架构设计:
- 原生动态分辨率(Naive Dynamic Resolution):不再把图像缩放到固定分辨率,而是按原始长宽比处理任意分辨率的图像,动态生成的视觉 token 数量随图像大小变化;
- MRoPE 多模态旋转位置编码:将位置编码分解为时间、高度、宽度三个分量,统一处理文本与视觉的位置信息,并支持与绝对时间对齐(视频理解中按时间戳定位事件)。
2025 年 4 月 8 日,官方开源了 Qwen2-VL 与 Qwen2.5-VL 的微调代码(GitHub 仓库 qwen-vl-finetune 目录),社区可以低成本微调出自己的视觉模型。
四、下一代:Qwen3-VL 全面升级
官方对 Qwen3-VL 的定位是「Qwen 系列迄今最强大的视觉语言模型」(原文:”Meet Qwen3-VL — the most powerful vision-language model in the Qwen series to date.”)。官方 README 列出的关键增强:
- Visual Agent:操作 PC/手机 GUI——识别元素、理解功能、调用工具、完成任务;
- Visual Coding Boost:从图片/视频生成 Draw.io/HTML/CSS/JS;
- 高级空间感知:判断物体位置、视角与遮挡;更强的 2D grounding,并首次支持 3D grounding(面向空间推理与具身智能);
- 长上下文与视频理解:原生 256K 上下文、可扩展至 1M;支持整本书与数小时视频,召回完整并支持秒级索引;
- 增强多模态推理:STEM/数学上的因果分析与逻辑推理;
- 升级视觉识别:更广、更高质量的预训练——名人、动漫、商品、地标、动植物「识别一切」;
- OCR 扩展:支持语言从 10 种增至 32 种,低光、模糊、倾斜场景更稳健,长文档结构解析更好;
- 文本理解比肩纯 LLM:文本-视觉无缝融合、无损统一理解。
五、Qwen3-VL 家族规格
| 发布日期 | 模型 | 说明 |
|---|---|---|
| 2025.09.23 | Qwen3-VL-235B-A22B(Instruct/Thinking) | 旗舰 MoE |
| 2025.10.04 | Qwen3-VL-30B-A3B(Instruct/Thinking)+ 全系 FP8 版本 | 中等规模 MoE |
| 2025.10.15 | Qwen3-VL-4B、8B(Instruct/Thinking) | 小尺寸 Dense |
| 2025.10.21 | Qwen3-VL-2B、32B(Instruct/Thinking) | 补齐家族 |
官方描述:「提供 Dense 与 MoE 架构、从边缘到云端的规模覆盖,并有 Instruct 与推理增强的 Thinking 两种版本,支持灵活的按需部署。」规格要点:图像 patch size 为 16(Qwen2.5-VL 为 14),空间压缩比 32×(单图 visual tokens 可控范围 256–1280),视频为 32× 空间 + 2× 时间压缩(单视频 256–16384);依赖 transformers>=4.57.0、vLLM>=0.11.0。
六、三项架构革新
Qwen3-VL 相对 Qwen2.5-VL 的核心架构更新(官方 README 原文):
- Interleaved-MRoPE:通过鲁棒的位置嵌入,在时间、宽、高维度上做全频率分配,增强长时程视频推理;
- DeepStack:融合多层级 ViT 特征,捕捉细粒度细节、锐化图文对齐;
- Text-Timestamp Alignment:超越 T-RoPE,实现精确的、基于时间戳的事件定位,强化视频时序建模。
七、部署实践
vLLM 部署命令(官方 README 原文,FP8 检查点):
# 要求 NVIDIA H100+ 与 CUDA 12+
vllm serve Qwen/Qwen3-VL-235B-A22B-Instruct-FP8 \
--tensor-parallel-size 8 \
--mm-encoder-tp-mode data \
--enable-expert-parallel \
--async-scheduling \
--media-io-kwargs '{"video": {"num_frames": -1}}' \
--host 0.0.0.0 \
--port 22002
超过 256K token 的输入使用 YaRN 长度外推扩展到 1M;由于 Interleaved-MRoPE 的位置 ID 增长慢于普通 RoPE,官方提醒使用更小的缩放因子(256K 扩展到 1M 时 factor 取 2 或 3,而不是 4)。
八、版本时间线
| 日期 | 事件 |
|---|---|
| 2025.10.04~21 | Qwen3-VL 全家族(2B~235B)与 FP8 版本发布完毕 |
| 2025.09.23 | Qwen3-VL-235B-A22B 发布 |
| 2025.04.08 | Qwen2-VL / Qwen2.5-VL 微调代码开源 |
| 2025.03.25 | Qwen2.5-VL-32B 发布 |
| 2025.02.20 | Qwen2.5-VL 技术报告发布 + AWQ 量化版 |
| 2025.01.28 | Qwen2.5-VL 系列发布 |
参考来源
- Qwen2.5-VL 发布博客(qwenlm.github.io/blog/qwen2.5-vl/)
- Qwen3-VL 官方 GitHub README(github.com/QwenLM/Qwen3-VL)
- Qwen2.5-VL 技术报告(arXiv:2502.13923)
- Qwen2.5-VL 微调代码(github.com/QwenLM/Qwen2.5-VL,qwen-vl-finetune 目录)
本文为技术文档摘录整理,内容合并自下列官方资料(官方文档、官方 GitHub 仓库、论文与权威媒体报道),技术数字以官方原文为准,版权归原作者所有。
