2025 年 4 月 29 日,阿里通义千问团队发布 Qwen3 系列并全面开源。据官方发布博客,Qwen3 是「混合专家(MoE)模型与稠密(Dense)模型的组合」,包含 8 款不同规模的开源权重模型:0.6B、1.7B、4B、8B、14B、32B 六款稠密模型,以及 30B-A3B、235B-A22B 两款混合专家模型。此后 Qwen3 家族持续迭代——本文合并 Qwen 官方发布博客与 Qwen3 官方 GitHub README,对整个家族做一次完整梳理。

一、模型家族总览
Qwen3-2504 初始版本发布时的家族构成(官方 README 原文:”Dense and Mixture-of-Experts (MoE) models of various sizes, available in 0.6B, 1.7B, 4B, 8B, 14B, 32B and 30B-A3B, 235B-A22B.”):
| 类型 | 模型规格 |
|---|---|
| 稠密 Dense | Qwen3-0.6B / 1.7B / 4B / 8B / 14B / 32B |
| 混合专家 MoE | Qwen3-30B-A3B(总参数 30B,每 token 激活 3B) |
| 混合专家 MoE | Qwen3-235B-A22B(总参数 235B,每 token 激活 22B) |
两款 MoE 模型的意义在于大幅降低推理成本:235B-A22B 虽然拥有旗舰级的总参数量,但每个 token 仅激活 22B 参数,30B-A3B 更是只激活 3B,即可在消费级硬件上获得接近旗舰的效果。

二、2507 更新系列:Instruct 与 Thinking 分化
2025 年 7 月起,Qwen3 推出了 2507 更新系列,将原版的「思考/非思考双模式」拆分为两个独立系列,官方 README 的表述为「两种变体,三种尺寸」:
| 发布日期 | 模型 | 定位 |
|---|---|---|
| 2025.07.21 | Qwen3-235B-A22B-Instruct-2507 | 非思考模式旗舰 |
| 2025.07.25 | Qwen3-235B-A22B-Thinking-2507 | 思考模式旗舰 |
| 2025.07.30 | Qwen3-30B-A3B-Instruct-2507 | 非思考模式中等规模 |
| 2025.07.31 | Qwen3-30B-A3B-Thinking-2507 | 思考模式中等规模 |
| 2025.08.06 | Qwen3-4B-Instruct-2507 / Thinking-2507 | 小尺寸版本(最终开源发布) |
Qwen3-Instruct-2507 的官方特性描述(原文):
- 通用能力的显著提升,包括指令遵循、逻辑推理、文本理解、数学、科学、编程和工具使用;
- 在多种语言的长尾知识覆盖上有大幅增长;
- 在主观和开放式任务上与用户偏好对齐明显更好,回复更有用、文本质量更高;
- 增强的 256K token 长上下文理解能力,可扩展至 100 万 token。
Qwen3-Thinking-2507 的官方特性描述(原文):
- 在推理任务上性能显著提升,覆盖逻辑推理、数学、科学、编程以及通常需要人类专业知识的学术基准——在开源权重思考模型中达到最先进(SOTA)水平;
- 指令遵循、工具使用、文本生成与人类偏好对齐等通用能力同样明显更好;
- 增强的 256K 长上下文理解,可扩展至 100 万 token。
2025 年 8 月 8 日,官方宣布 Qwen3-2507 系列已支持 100 万 token(1M)超长输入,覆盖 235B-A22B 与 30B-A3B 的 Instruct/Thinking 全部四个型号。
三、初始版本的核心特性
Qwen3-2504 初始版本(2025 年 4 月)的四大官方特性,其中「思考模式无缝切换」是这一代最受关注的设计:
- 思考/非思考模式无缝切换:复杂逻辑推理、数学、编程用思考模式,高效通用对话用非思考模式,确保各类场景下的最优表现;
- 推理能力显著增强:思考模式下超越此前的 QwQ,非思考模式下超越 Qwen2.5-Instruct(数学、代码生成、常识逻辑推理);
- 人类偏好对齐出色:创意写作、角色扮演、多轮对话与指令跟随表现领先,对话体验更自然;
- Agent 能力专精:思考与非思考模式下都能精准调用外部工具,在复杂 Agent 任务上取得开源模型领先成绩;
- 支持 100+ 语言与方言,多语言指令遵循与翻译能力强。
四、部署实践:vLLM 与 SGLang
官方 README 给出了完整的部署命令(逐字保留)。vLLM(推荐 vllm>=0.9.0):
# Qwen3-Instruct-2507
vllm serve Qwen/Qwen3-30B-A3B-Instruct-2507 --port 8000 --max-model-len 262144
# Qwen3-Thinking-2507
vllm serve Qwen/Qwen3-30B-A3B-Thinking-2507 --port 8000 --max-model-len 262144 --enable-reasoning --reasoning-parser deepseek_r1
# Qwen3(原始版)
vllm serve Qwen/Qwen3-8B --port 8000 --max-model-len 131072 --enable-reasoning --reasoning-parser qwen3
启动后即提供 OpenAI 兼容 API:http://localhost:8000/v1。SGLang(要求 sglang>=0.4.6.post1):
# Qwen3-Instruct-2507
python -m sglang.launch_server --model-path Qwen/Qwen3-30B-A3B-Instruct-2507 --port 30000 --context-length 262144
# Qwen3-Thinking-2507
python -m sglang.launch_server --model-path Qwen/Qwen3-30B-A3B-Thinking-2507 --port 30000 --context-length 262144 --reasoning-parser deepseek-r1
官方特别提示:由于 vLLM/SGLang 对 API 请求的预处理会丢弃 reasoning_content 字段,思考模型的多步工具调用质量可能受限,官方建议将内容原样传入而不抽取思考内容,由 chat template 正确处理。
其他官方支持的部署方式还包括:TensorRT-LLM(tensorrt_llm>=0.20.0rc3,trtllm-serve Qwen/Qwen3-8B --host localhost --port 8000 --backend pytorch)、华为昇腾 MindIE、llama.cpp(>=b5401)、Ollama(>=0.9.0)、LMStudio、ExecuTorch、MNN、MLX LM(>=0.24.0,Apple Silicon)、OpenVINO 等。
五、transformers 使用与思考内容解析
transformers 要求 >=4.51.0。Thinking 模型的输出解析(官方示例,核心部分):
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen3-30B-A3B-Thinking-2507"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype="auto", device_map="auto")
messages = [{"role": "user", "content": "Give me a short introduction to large language model."}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
generated_ids = model.generate(**model_inputs, max_new_tokens=32768)
output_ids = generated_ids[0][len(model_inputs.input_ids[0]):].tolist()
# 解析思考内容:查找 </think> 标记 (token id 151668)
try:
index = len(output_ids) - output_ids[::-1].index(151668)
except ValueError:
index = 0
thinking_content = tokenizer.decode(output_ids[:index], skip_special_tokens=True).strip("\n")
content = tokenizer.decode(output_ids[index:], skip_special_tokens=True).strip("\n")
print("thinking content:", thinking_content)
print("content:", content)
chat template 的关键差异(官方说明):
- Qwen3-Instruct-2507 仅支持非思考模式,输出不含
<think>块,无需再传enable_thinking=False; - Qwen3-Thinking-2507 仅支持思考模式,chat template 默认包含
</think>,因此输出只含闭合标签属正常现象;官方强烈建议为复杂推理任务预留充足的生成长度; - 旧版 Qwen3 双模式模型可用
enable_thinking=False或/think、/no_think指令切换,多轮对话以最新指令为准。
六、本地运行注意事项
官方 README 对 Ollama 用户有两条重要提醒:
- 命名不一致:Ollama 的命名与 Qwen 原始命名可能不同,例如
qwen3:30b-a3b实际指向qwen3:30b-a3b-thinking-2507-q4_K_M; - 上下文默认值过小:Ollama 沿用 llama.cpp 的「轮转上下文管理」,默认
num_ctx2048 与num_predict-1(无限生成)对 Qwen3 可能出问题,官方建议执行/set parameter num_ctx 40960与/set parameter num_predict 32768。
llama.cpp 官方推荐生成参数:--temp 0.6 --top-k 20 --top-p 0.95 --min-p 0 -c 40960 -n 32768 --no-context-shift。
七、微调与工具调用
官方建议使用 Axolotl、Unsloth、Swift、Llama-Factory 等训练框架进行 SFT、DPO、GRPO 微调;工具调用能力推荐配合 Qwen-Agent 使用,它对相关 API 做了封装,支持工具使用/函数调用并兼容 MCP。
八、版本演进时间线
| 日期 | 事件 |
|---|---|
| 2025.08.08 | Qwen3-2507 全系支持 100 万 token 超长输入 |
| 2025.08.06 | Qwen3-4B-Instruct/Thinking-2507 发布(最终开源发布) |
| 2025.07.30-31 | Qwen3-30B-A3B-Instruct/Thinking-2507 发布 |
| 2025.07.21-25 | Qwen3-235B-A22B-Instruct/Thinking-2507 发布 |
| 2025.04.29 | Qwen3 系列发布(0.6B~235B-A22B 八款开源) |
| 2024.09.19 | Qwen2.5 系列发布 |
| 2024.06.06 | Qwen2 系列发布 |
| 2024.03.28 | Qwen1.5-MoE-A2.7B(首个 MoE 模型) |
| 2024.02.05 | Qwen1.5 系列发布 |
九、许可证
官方 README 明确:“All our open-weight models are licensed under Apache 2.0.”(所有开源权重模型均采用 Apache 2.0 许可证),许可文件可在对应的 Hugging Face 仓库中找到。
参考来源
- Qwen3 官方 GitHub README(github.com/QwenLM/Qwen3)
- Qwen3 发布博客(qwenlm.github.io/blog/qwen3/)
- Qwen3 技术报告(arXiv:2505.09388)
- Qwen3 模型合集(huggingface.co/collections/Qwen/qwen3-67dd247413f0e2e4f653967f)
本文为技术文档摘录整理,内容合并自下列官方资料(官方文档、官方 GitHub 仓库、论文与权威媒体报道),技术数字以官方原文为准,版权归原作者所有。


