能读文档还会操作电脑,Qwen2.5-VL 把多模态卷出了新高度

Qwen2.5-VL 是通义千问团队的视觉语言模型(VLM)系列,2025 年 1 月 28 日发布并开源,被视为开源多模态模型的标杆之作——它不仅「看图说话」,还能解析文档、操作电脑、在图上精准定位。2025 年下半年,下一代 Qwen3-VL 接续发布。本文合并 Qwen 官方博客Qwen-VL 官方 GitHub README,完整梳理这两代模型。

资料图:Qwen2.5-VL 官方横幅(图片来自 Qwen 官方博客)
资料图:Qwen2.5-VL 官方横幅(图片来自 Qwen 官方博客)

一、Qwen2.5-VL 三大核心能力

据官方发布博客,Qwen2.5-VL 的能力覆盖三大方向:

1. 文档解析

从单纯的 OCR 升级到全解析:输出文本内容的同时保留布局位置信息(坐标、表格结构),并支持 Qwen HTML 格式输出。官方描述其能处理多场景、多语言、多样式的手写与印刷文档,在 DocVQA 等文档理解基准上达到 SOTA。

资料图:Qwen2.5-VL 文档解析效果(图片来自 Qwen 官方博客)
资料图:Qwen2.5-VL 文档解析效果(图片来自 Qwen 官方博客)

2. Agent 操作

Qwen2.5-VL 是首个在此代引入视觉 Agent 能力的开源模型:能对手机与电脑 GUI 进行长程规划、精准定位 UI 元素并逐步执行操作,在 MSAgent-Bench 等移动 Agent 基准上成绩领先,可自动完成订票、点外卖等端到端任务。

3. 视觉定位

支持绝对坐标相对坐标两套定位体系:既能输出图中文本的精确边界框,也能用「左上/右下」等相对语言描述区域;点击定位支持单点、多点、规则网格等多种形式。

资料图:Qwen2.5-VL 基准成绩(图片来自 Qwen 官方博客)
资料图:Qwen2.5-VL 基准成绩(图片来自 Qwen 官方博客)

二、模型家族与显存需求

Qwen2.5-VL 提供 3B、7B、32B、72B 四个尺寸;2025 年 2 月 20 日发布技术报告(arXiv:2502.13923)的同时发布了 3B/7B/72B 三个尺寸的 AWQ 量化版。官方 README 附表给出了 transformers 推理的理论最小显存需求:

精度Qwen2.5-VL-3BQwen2.5-VL-7BQwen2.5-VL-72B
FP3211.5 GB26.34 GB266.21 GB
BF165.75 GB13.17 GB133.11 GB
INT82.87 GB6.59 GB66.5 GB
INT41.44 GB3.29 GB33.28 GB

官方注:「实际显存占用通常至少是理论值的 1.2 倍。」

三、架构基础

Qwen2.5-VL 的两个关键架构设计:

  • 原生动态分辨率(Naive Dynamic Resolution):不再把图像缩放到固定分辨率,而是按原始长宽比处理任意分辨率的图像,动态生成的视觉 token 数量随图像大小变化;
  • MRoPE 多模态旋转位置编码:将位置编码分解为时间、高度、宽度三个分量,统一处理文本与视觉的位置信息,并支持与绝对时间对齐(视频理解中按时间戳定位事件)。

2025 年 4 月 8 日,官方开源了 Qwen2-VL 与 Qwen2.5-VL 的微调代码(GitHub 仓库 qwen-vl-finetune 目录),社区可以低成本微调出自己的视觉模型。

四、下一代:Qwen3-VL 全面升级

官方对 Qwen3-VL 的定位是「Qwen 系列迄今最强大的视觉语言模型」(原文:”Meet Qwen3-VL — the most powerful vision-language model in the Qwen series to date.”)。官方 README 列出的关键增强:

  • Visual Agent:操作 PC/手机 GUI——识别元素、理解功能、调用工具、完成任务;
  • Visual Coding Boost:从图片/视频生成 Draw.io/HTML/CSS/JS;
  • 高级空间感知:判断物体位置、视角与遮挡;更强的 2D grounding,并首次支持 3D grounding(面向空间推理与具身智能);
  • 长上下文与视频理解:原生 256K 上下文、可扩展至 1M;支持整本书与数小时视频,召回完整并支持秒级索引;
  • 增强多模态推理:STEM/数学上的因果分析与逻辑推理;
  • 升级视觉识别:更广、更高质量的预训练——名人、动漫、商品、地标、动植物「识别一切」;
  • OCR 扩展:支持语言从 10 种增至 32 种,低光、模糊、倾斜场景更稳健,长文档结构解析更好;
  • 文本理解比肩纯 LLM:文本-视觉无缝融合、无损统一理解。

五、Qwen3-VL 家族规格

发布日期模型说明
2025.09.23Qwen3-VL-235B-A22B(Instruct/Thinking)旗舰 MoE
2025.10.04Qwen3-VL-30B-A3B(Instruct/Thinking)+ 全系 FP8 版本中等规模 MoE
2025.10.15Qwen3-VL-4B、8B(Instruct/Thinking)小尺寸 Dense
2025.10.21Qwen3-VL-2B、32B(Instruct/Thinking)补齐家族

官方描述:「提供 Dense 与 MoE 架构、从边缘到云端的规模覆盖,并有 Instruct 与推理增强的 Thinking 两种版本,支持灵活的按需部署。」规格要点:图像 patch size 为 16(Qwen2.5-VL 为 14),空间压缩比 32×(单图 visual tokens 可控范围 256–1280),视频为 32× 空间 + 2× 时间压缩(单视频 256–16384);依赖 transformers>=4.57.0、vLLM>=0.11.0。

六、三项架构革新

Qwen3-VL 相对 Qwen2.5-VL 的核心架构更新(官方 README 原文):

  1. Interleaved-MRoPE:通过鲁棒的位置嵌入,在时间、宽、高维度上做全频率分配,增强长时程视频推理;
  2. DeepStack:融合多层级 ViT 特征,捕捉细粒度细节、锐化图文对齐;
  3. Text-Timestamp Alignment:超越 T-RoPE,实现精确的、基于时间戳的事件定位,强化视频时序建模。

七、部署实践

vLLM 部署命令(官方 README 原文,FP8 检查点):

# 要求 NVIDIA H100+ 与 CUDA 12+
vllm serve Qwen/Qwen3-VL-235B-A22B-Instruct-FP8 \
  --tensor-parallel-size 8 \
  --mm-encoder-tp-mode data \
  --enable-expert-parallel \
  --async-scheduling \
  --media-io-kwargs '{"video": {"num_frames": -1}}' \
  --host 0.0.0.0 \
  --port 22002

超过 256K token 的输入使用 YaRN 长度外推扩展到 1M;由于 Interleaved-MRoPE 的位置 ID 增长慢于普通 RoPE,官方提醒使用更小的缩放因子(256K 扩展到 1M 时 factor 取 2 或 3,而不是 4)。

八、版本时间线

日期事件
2025.10.04~21Qwen3-VL 全家族(2B~235B)与 FP8 版本发布完毕
2025.09.23Qwen3-VL-235B-A22B 发布
2025.04.08Qwen2-VL / Qwen2.5-VL 微调代码开源
2025.03.25Qwen2.5-VL-32B 发布
2025.02.20Qwen2.5-VL 技术报告发布 + AWQ 量化版
2025.01.28Qwen2.5-VL 系列发布

参考来源

  • Qwen2.5-VL 发布博客(qwenlm.github.io/blog/qwen2.5-vl/)
  • Qwen3-VL 官方 GitHub README(github.com/QwenLM/Qwen3-VL)
  • Qwen2.5-VL 技术报告(arXiv:2502.13923)
  • Qwen2.5-VL 微调代码(github.com/QwenLM/Qwen2.5-VL,qwen-vl-finetune 目录)

本文为技术文档摘录整理,内容合并自下列官方资料(官方文档、官方 GitHub 仓库、论文与权威媒体报道),技术数字以官方原文为准,版权归原作者所有。

主要菜单