训练成本砍掉九成,Qwen3.8-Flash-Next 用新架构做到了

2026 年 8 月 26 日晚,阿里巴巴发布并同步开源千问最新模型 Qwen3.8-Flash-Next(国内媒体多称 Qwen3.8-Flash)。据 Qwen 官方研究博客,这是一个多模态 MoE 模型,同时是 Qwen4 所用架构的早期预览——它扮演的角色与当年 Qwen3-Next 之于 Qwen3.5 相同:Qwen3-Next 引入的 Gated DeltaNet + Gated Attention 混合设计,随后被 Qwen3.5、Qwen3.6、Qwen3.7 和 Qwen3.8 全系列沿用。官方表示「我们再次提前释放架构变化,让社区可以在完整的 Qwen4 模型家族构建之前先行审视它们」。

资料图:Qwen 系列(图片来自 Qwen 官方博客此前发布的 Qwen3 宣传图)

一、模型规格

综合官方博客模型卡与新京报贝壳财经报道:

项目数值
主模型(Transformer)总参数125B
N-gram Embedding 额外参数51B
每 token 激活参数6B
原生上下文长度262,144 tokens(256K)
YaRN 扩展后上下文1,000,000 tokens(1M)
模型类型多模态 MoE
API 定价(国际站)输入 $0.15 / 百万 tokens,输出 $0.47 / 百万 tokens
API 定价(国内,据新京报)输入 1 元 / 百万 tokens,输出 3 元 / 百万 tokens

与同代模型对比(官方对比表):Qwen3.8-Flash-Next 为 125B 总参 / 6B 激活 / 51B N-gram 参数;Qwen3.8-27B 为 27B / 27B;Qwen3.7-Plus 为 397B / 17B;DeepSeek-V4-Flash-0731 为 284B / 13B。也就是说,它以 6B 的激活参数,在与千亿级模型的同场竞技中取得了极具竞争力的成绩——新京报报道称其性能超越 Claude Opus 4.6、接近 Opus 4.8,创下模型效率的全球新基准;性能与上一代 Qwen3.7-Plus 接近,但仅用九分之一的资源便完成了训练

二、架构革新:四个方向的系统性升级

1. 注意力:GDN + QSA 混合架构

Qwen3.8-Flash-Next 采用 GDN + Attention 混合架构:每 4 层中有 3 层使用 Gated DeltaNet(GDN),将历史信息持续压缩进一个固定大小的状态;剩余 1 层使用全局 Attention,对全上下文做精确检索。在此基础上,QSA(Qwen Sparse Attention) 进一步压缩注意力成本:一个轻量级 indexer 先将序列聚合为微块(micro-blocks),在块级别估计上下文重要性,再选择最相关的区域做 Attention——这不仅降低了 Attention 本身的开销,也降低了识别重要上下文所需的索引开销。与跨层共享索引的方案(如 IndexCache)不同,QSA 在每层内独立做序列压缩,特别适合 GDN 与 Attention 交错排布的混合架构。

官方博客的概括是:「GDN 高效地『记忆』,QSA 精确地『检索』。」官方还与 DeepSeek-V3.2 的 DSA 做了对比:DSA 仍依赖 token 级 indexer 定位重要位置,随着上下文增长,indexer 本身会成为不可忽视的计算开销来源。

2. Gated Residual:残差流扩为 4 条分支

Gated Residual(GR)结合了两个思路:沿用 Hyper-Connection 将残差流拓宽为多分支的做法,并融入 GatedNorm 的逐元素动态门控读取。原始单一残差流被扩展为 4 条并行分支,模型可根据当前内容动态决定从每条分支读多少信息、写回多少信息。实证分析发现,其中一条分支会自然演化为连接第一个 Attention 层与后续大多数层的「长程通道」。GR 还简化了 Hyper-Connection:当读写操作足够有表达力时,额外的分支混合没有明显收益,可以直接去掉,从而降低显存访问开销和不稳定来源;门控还能有效抑制激活值异常(activation outliers)。残差状态支持 FP8 存储,进一步降低访存开销。

3. N-gram Embedding:51B 参数的「本地模式记忆」

受 Gemma 3n 的 Per-Layer Embedding 和 DeepSeek Engram 等工作启发,Qwen 引入 N-gram Embedding 在 Transformer 主干之外扩展模型容量:标准 Embedding 只按单个 token 查表,N-gram Embedding 则用当前 token 与前若干 token 构成的局部上下文查表,为常见短语和局部模式提供额外表示。其关键优势是几乎不为每 token 计算增加任何开销就能加入大量参数:由于查表位置可以提前确定,这 51B 参数可以放在主机内存(Host Memory)中,与模型计算异步并行预取,不永久占用 GPU 显存。最终模型只在网络开头附近使用单层 N-gram Embedding,相当于以较低代价外挂了一个大规模「本地模式记忆」。

4. 优化器:Muon 及其大规模训练改进

模型使用 Muon 优化器训练,并围绕三个方面做了大规模应用改进:正交化精度、Muon 与 AdamW 的参数分配(Attention/GDN/MoE 专家主权重用 Muon,Embedding、MoE Router 和 GR 低秩参数继续用 AdamW)、融合参数矩阵的拆分(QKV、SwiGLU、GDN 投影先按独立线性变换拆分再分别正交化)。团队还发现,大规模训练常用的 Batch Size Warmup 其实不再必要:从小 batch 逐渐升到目标 batch 并不改善最终结果,反而需要多 18.8% 的优化器步数——最终配方直接从目标 Batch Size 起训。重拟合的 Scaling Law 表明模型可以稳定使用更大的学习率与 Batch Size,进一步提升收敛效率和大规�模并行训练吞吐。

其他架构细节还包括:超稀疏 MoE(全局负载均衡,固定激活专家数、增大总专家参数可稳定降低训练损失,含 1 个共享专家)、多 Token 预测(MTP)多步训练(训练与推理一致,提高投机解码接受率,其 full-attention 层同样替换为 QSA),以及多项训练稳定性技巧(Zero-centered RMSNorm、attention output gating、归一化 MoE Router 初始化)。

三、成本与性能数据

  • 训练成本:约为 Qwen3.7-Plus 的 1/9,但在编程与办公任务上能力更强;
  • QSA Attention Kernel 在 1M tokens 下:Prefill 加速 7.6×,Decode 加速 4.9×
  • 在线服务典型场景(90% 前缀缓存命中率):1M token 上下文下 Prefill 吞吐为 Qwen3.7-Plus 的 8.6×
  • 新京报报道:在高缓存命中的 1M Tokens 长上下文实际场景中可提速 8 倍以上,推理价格最低至 DeepSeek-V4-Flash 的 1/3。

四、评测成绩(官方博客数据)

语言能力(后训练模型,节选)

基准Flash-NextQwen3.8-27BQwen3.7-PlusDS-V4-Flash-0731Opus 4.6
DeepSWE 1.158.742.216.554.4
SWE-bench Pro62.561.755.856.053.4
SWE-bench Multilingual81.073.875.877.5
CoWorkBench73.970.765.145.168.2
JobBench55.733.427.641.336.6
Toolathlon Verified (Pass@1)73.567.150.670.3
IFBench81.379.579.179.262.5
GPQA Diamond91.789.290.390.891.3
LiveCodeBench v691.990.389.690.688.8

视觉语言能力(节选)

基准Flash-NextQwen3.8-27BQwen3.7-PlusOpus 4.6
AndroidWorld84.581.981.062.0
OSWorld 2.0 (Partial)52.348.021.5
RecreationBench49.947.130.2
RealWorldQA88.585.986.973.9
LVBench76.672.476.263.0

Base 模型

官方结论:以 6B 激活参数,Qwen3.8-Flash-Next-Base 在 14 项基准中的 8 项取得最佳(对比 Qwen3.8-27B-Base 与 Qwen3.7-Plus-Base),包括 MMLU-Pro 73.23、SuperGPQA 51.36、BBH 90.87、EvalPlus 78.76、MGSM 89.33 等。

五、获取与部署

  • Hugging Face:huggingface.co/Qwen/Qwen3.8-Flash-Next
  • ModelScope:modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
  • 技术报告:github.com/QwenLM/Qwen3.8-Flash-Next(tech_report.pdf)
  • 生产版本 Qwen3.8-Flash 已上线 QwenCloud(默认 1M 上下文 + 官方内置工具),并驱动阿里 QwenWork 平台的「Standard」模式;模型当晚首发上线「千问办公」(据新京报)。

官方支持的编程 Agent 工具链相当丰富:Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 均给出配置方法。以 Claude Code 为例(命令摘自官方博客):

npm install -g @anthropic-ai/claude-code

export ANTHROPIC_MODEL="qwen3.8-flash"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-flash"
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<your_api_key>

claude

API 使用(OpenAI 兼容接口,示例摘自官方博客):

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url=os.environ.get(
        "DASHSCOPE_BASE_URL",
        "https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
    ),
)

completion = client.chat.completions.create(
    model="qwen3.8-flash",
    messages=[{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}],
    extra_body={"enable_thinking": True},
    reasoning_effort="xhigh",  # 支持 xhigh、medium、low 三档
    stream=True,
)

推理引擎方面,社区可通过 vLLM、SGLang 等主流框架部署;官方还同步开源了 FlashQLA 注意力算子库(github.com/QwenLM/FlashQLA)。

参考来源

  • Qwen 官方研究博客:Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency(qwen.ai,2026-08-26)
  • 新京报贝壳财经《阿里开源发布 Qwen3.8-Flash,训练成本骤降近 90%》(2026-08-26)

本文为资讯类内容,摘录整理自下列公开资料(官方博客、模型卡与权威媒体报道),技术数字以官方原文为准,版权归原作者所有。

主要菜单