Qwen3 全家桶都有哪些模型?从 0.6B 到 235B 梳理一遍

2025 年 4 月 29 日,阿里通义千问团队发布 Qwen3 系列并全面开源。据官方发布博客,Qwen3 是「混合专家(MoE)模型与稠密(Dense)模型的组合」,包含 8 款不同规模的开源权重模型:0.6B、1.7B、4B、8B、14B、32B 六款稠密模型,以及 30B-A3B、235B-A22B 两款混合专家模型。此后 Qwen3 家族持续迭代——本文合并 Qwen 官方发布博客Qwen3 官方 GitHub README,对整个家族做一次完整梳理。

资料图:Qwen3 系列发布横幅(图片来自 Qwen 官方博客)
资料图:Qwen3 系列发布横幅(图片来自 Qwen 官方博客)

一、模型家族总览

Qwen3-2504 初始版本发布时的家族构成(官方 README 原文:”Dense and Mixture-of-Experts (MoE) models of various sizes, available in 0.6B, 1.7B, 4B, 8B, 14B, 32B and 30B-A3B, 235B-A22B.”):

类型模型规格
稠密 DenseQwen3-0.6B / 1.7B / 4B / 8B / 14B / 32B
混合专家 MoEQwen3-30B-A3B(总参数 30B,每 token 激活 3B)
混合专家 MoEQwen3-235B-A22B(总参数 235B,每 token 激活 22B)

两款 MoE 模型的意义在于大幅降低推理成本:235B-A22B 虽然拥有旗舰级的总参数量,但每个 token 仅激活 22B 参数,30B-A3B 更是只激活 3B,即可在消费级硬件上获得接近旗舰的效果。

资料图:Qwen3-235B-A22B 评测成绩(图片来自 Qwen 官方博客)
资料图:Qwen3-235B-A22B 评测成绩(图片来自 Qwen 官方博客)

二、2507 更新系列:Instruct 与 Thinking 分化

2025 年 7 月起,Qwen3 推出了 2507 更新系列,将原版的「思考/非思考双模式」拆分为两个独立系列,官方 README 的表述为「两种变体,三种尺寸」:

发布日期模型定位
2025.07.21Qwen3-235B-A22B-Instruct-2507非思考模式旗舰
2025.07.25Qwen3-235B-A22B-Thinking-2507思考模式旗舰
2025.07.30Qwen3-30B-A3B-Instruct-2507非思考模式中等规模
2025.07.31Qwen3-30B-A3B-Thinking-2507思考模式中等规模
2025.08.06Qwen3-4B-Instruct-2507 / Thinking-2507小尺寸版本(最终开源发布)

Qwen3-Instruct-2507 的官方特性描述(原文):

  • 通用能力的显著提升,包括指令遵循、逻辑推理、文本理解、数学、科学、编程和工具使用
  • 多种语言的长尾知识覆盖上有大幅增长;
  • 在主观和开放式任务上与用户偏好对齐明显更好,回复更有用、文本质量更高;
  • 增强的 256K token 长上下文理解能力,可扩展至 100 万 token

Qwen3-Thinking-2507 的官方特性描述(原文):

  • 在推理任务上性能显著提升,覆盖逻辑推理、数学、科学、编程以及通常需要人类专业知识的学术基准——在开源权重思考模型中达到最先进(SOTA)水平
  • 指令遵循、工具使用、文本生成与人类偏好对齐等通用能力同样明显更好;
  • 增强的 256K 长上下文理解,可扩展至 100 万 token。

2025 年 8 月 8 日,官方宣布 Qwen3-2507 系列已支持 100 万 token(1M)超长输入,覆盖 235B-A22B 与 30B-A3B 的 Instruct/Thinking 全部四个型号。

三、初始版本的核心特性

Qwen3-2504 初始版本(2025 年 4 月)的四大官方特性,其中「思考模式无缝切换」是这一代最受关注的设计:

  • 思考/非思考模式无缝切换:复杂逻辑推理、数学、编程用思考模式,高效通用对话用非思考模式,确保各类场景下的最优表现;
  • 推理能力显著增强:思考模式下超越此前的 QwQ,非思考模式下超越 Qwen2.5-Instruct(数学、代码生成、常识逻辑推理);
  • 人类偏好对齐出色:创意写作、角色扮演、多轮对话与指令跟随表现领先,对话体验更自然;
  • Agent 能力专精:思考与非思考模式下都能精准调用外部工具,在复杂 Agent 任务上取得开源模型领先成绩;
  • 支持 100+ 语言与方言,多语言指令遵循与翻译能力强。

四、部署实践:vLLM 与 SGLang

官方 README 给出了完整的部署命令(逐字保留)。vLLM(推荐 vllm>=0.9.0):

# Qwen3-Instruct-2507
vllm serve Qwen/Qwen3-30B-A3B-Instruct-2507 --port 8000 --max-model-len 262144

# Qwen3-Thinking-2507
vllm serve Qwen/Qwen3-30B-A3B-Thinking-2507 --port 8000 --max-model-len 262144 --enable-reasoning --reasoning-parser deepseek_r1

# Qwen3(原始版)
vllm serve Qwen/Qwen3-8B --port 8000 --max-model-len 131072 --enable-reasoning --reasoning-parser qwen3

启动后即提供 OpenAI 兼容 API:http://localhost:8000/v1SGLang(要求 sglang>=0.4.6.post1):

# Qwen3-Instruct-2507
python -m sglang.launch_server --model-path Qwen/Qwen3-30B-A3B-Instruct-2507 --port 30000 --context-length 262144

# Qwen3-Thinking-2507
python -m sglang.launch_server --model-path Qwen/Qwen3-30B-A3B-Thinking-2507 --port 30000 --context-length 262144 --reasoning-parser deepseek-r1

官方特别提示:由于 vLLM/SGLang 对 API 请求的预处理会丢弃 reasoning_content 字段,思考模型的多步工具调用质量可能受限,官方建议将内容原样传入而不抽取思考内容,由 chat template 正确处理。

其他官方支持的部署方式还包括:TensorRT-LLM(tensorrt_llm>=0.20.0rc3,trtllm-serve Qwen/Qwen3-8B --host localhost --port 8000 --backend pytorch)、华为昇腾 MindIE、llama.cpp(>=b5401)、Ollama(>=0.9.0)、LMStudio、ExecuTorch、MNN、MLX LM(>=0.24.0,Apple Silicon)、OpenVINO 等。

五、transformers 使用与思考内容解析

transformers 要求 >=4.51.0。Thinking 模型的输出解析(官方示例,核心部分):

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen3-30B-A3B-Thinking-2507"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="auto", device_map="auto")

messages = [{"role": "user", "content": "Give me a short introduction to large language model."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
generated_ids = model.generate(**model_inputs, max_new_tokens=32768)
output_ids = generated_ids[0][len(model_inputs.input_ids[0]):].tolist()

# 解析思考内容:查找 </think> 标记 (token id 151668)
try:
    index = len(output_ids) - output_ids[::-1].index(151668)
except ValueError:
    index = 0
thinking_content = tokenizer.decode(output_ids[:index], skip_special_tokens=True).strip("\n")
content = tokenizer.decode(output_ids[index:], skip_special_tokens=True).strip("\n")
print("thinking content:", thinking_content)
print("content:", content)

chat template 的关键差异(官方说明):

  • Qwen3-Instruct-2507 仅支持非思考模式,输出不含 <think> 块,无需再传 enable_thinking=False
  • Qwen3-Thinking-2507 仅支持思考模式,chat template 默认包含 </think>,因此输出只含闭合标签属正常现象;官方强烈建议为复杂推理任务预留充足的生成长度;
  • 旧版 Qwen3 双模式模型可用 enable_thinking=False/think/no_think 指令切换,多轮对话以最新指令为准。

六、本地运行注意事项

官方 README 对 Ollama 用户有两条重要提醒:

  • 命名不一致:Ollama 的命名与 Qwen 原始命名可能不同,例如 qwen3:30b-a3b 实际指向 qwen3:30b-a3b-thinking-2507-q4_K_M
  • 上下文默认值过小:Ollama 沿用 llama.cpp 的「轮转上下文管理」,默认 num_ctx 2048 与 num_predict -1(无限生成)对 Qwen3 可能出问题,官方建议执行 /set parameter num_ctx 40960/set parameter num_predict 32768

llama.cpp 官方推荐生成参数:--temp 0.6 --top-k 20 --top-p 0.95 --min-p 0 -c 40960 -n 32768 --no-context-shift

七、微调与工具调用

官方建议使用 Axolotl、Unsloth、Swift、Llama-Factory 等训练框架进行 SFT、DPO、GRPO 微调;工具调用能力推荐配合 Qwen-Agent 使用,它对相关 API 做了封装,支持工具使用/函数调用并兼容 MCP。

八、版本演进时间线

日期事件
2025.08.08Qwen3-2507 全系支持 100 万 token 超长输入
2025.08.06Qwen3-4B-Instruct/Thinking-2507 发布(最终开源发布)
2025.07.30-31Qwen3-30B-A3B-Instruct/Thinking-2507 发布
2025.07.21-25Qwen3-235B-A22B-Instruct/Thinking-2507 发布
2025.04.29Qwen3 系列发布(0.6B~235B-A22B 八款开源)
2024.09.19Qwen2.5 系列发布
2024.06.06Qwen2 系列发布
2024.03.28Qwen1.5-MoE-A2.7B(首个 MoE 模型)
2024.02.05Qwen1.5 系列发布

九、许可证

官方 README 明确:“All our open-weight models are licensed under Apache 2.0.”(所有开源权重模型均采用 Apache 2.0 许可证),许可文件可在对应的 Hugging Face 仓库中找到。

参考来源

  • Qwen3 官方 GitHub README(github.com/QwenLM/Qwen3)
  • Qwen3 发布博客(qwenlm.github.io/blog/qwen3/)
  • Qwen3 技术报告(arXiv:2505.09388)
  • Qwen3 模型合集(huggingface.co/collections/Qwen/qwen3-67dd247413f0e2e4f653967f)

本文为技术文档摘录整理,内容合并自下列官方资料(官方文档、官方 GitHub 仓库、论文与权威媒体报道),技术数字以官方原文为准,版权归原作者所有。

主要菜单