Qwen 头一回把 Max 级权重开放了,2.4 万亿参数直接可下载

2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰基座大模型 Qwen3.8-Max,据钱江晚报报道,这是千问大模型系列中尺寸最大、性能最强的模型,总参数量 2.4 万亿,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。更重要的信号是:这是 Qwen-Max 级别模型的权重首次开源——开放权重于发布后一周放出(ModelScope / Hugging Face 上的模型名为 Qwen3.8-2.4T-A95B)。

资料图:Qwen 官方此前发布的基准对比图(Qwen3-235B-A22B)
资料图:Qwen 官方此前发布的基准对比图(Qwen3-235B-A22B)

一、模型规格

综合官方博客、ModelScope 模型卡与媒体报道:

项目数值
总参数2.4T
每 token 激活参数95B
MoE 结构每层 512 个专家,每 token 选择 10 个路由专家 + 1 个共享专家
原生上下文262,144 tokens(256K)
扩展上下文1,010,000 tokens(约 101 万)
多 Token 预测(MTP)多步训练,支持相应推理引擎的多 token 预测
视觉理解支持(多模态输入)
思考模式默认思考模式运行,不支持关闭;reasoning_effort 支持 xhigh(默认)/ medium / low

架构上,Qwen3.8 延续 Qwen3.5 的混合架构(稀疏 MoE + 混合注意力机制联合优化),首次将千问大模型总参数量拓展至 2.4T。模型卡特别说明:「激活 95B」描述的是单 token 计算路径,不等同于模型权重或运行时显存只需 95B 规模。云端版 Qwen3.8-Max 基于该开放权重模型,并加入更多生产环境能力。

二、编程能力:三个「无人工介入」的自主编程案例

官方博客强调,对顶级模型而言,编程意味着「把一个真实的多天项目从空文件夹独立做到完成」。Qwen 团队展示了三个全程无人工帮助的挑战,共同主题是:模型通过反馈循环自我进化

案例 1:10+ 天自主编程,构建自进化 Harness

Qwen3.8-Max 被要求从零创建 oh-my-cli 项目和一套可持续运行的编程 Harness:它将用户反馈、社区实践与自身自测结果纳入同一个工程循环——需求被规范化为 GitHub Issues,由 agent 通过状态机自动认领执行(ready → leased → active),完成后触发 E2E 测试与 CI 检查,通过后合并 PR。截至 2026 年 7 月 30 日,该流程在无人工介入的情况下连续运行约 16 天,累计 265 次 commit、127 个 PR、151 个 issue。完整轨迹公开在 GitHub 仓库 qwen-code-dev-bot/oh-my-cli。

案例 2:复现论文,然后做得更好

模型拿到研究论文《Unified Data Selection for LLM Reasoning》但没有起始代码,任务是先复现再改进。它连续工作约 125 小时(约 5 天),编写约 7,600 行代码,执行超过 1,100 步操作33 轮 GPU 训练:先复现了论文全部六项主要结论,随后在四轮探索中自主提出并验证 18 种改进方法,最终方案在 AIME24 数学基准受控实验中较复现基线再提高 2.71 分

案例 3:24 小时打进人类竞赛前列

在阿里天池平台 WWW2025 多模态对话意图识别挑战赛中(526 支人类战队参赛),Qwen3.8-Max 在 24 小时内微调多个中文模型与 Qwen2.5-VL-7B(用于商品截图),并组合成投票系统,通过 45 次提交将准确率从 0.60 提升至 0.853超越了 526 支人类战队中的 458 支

三、长程任务:芯片设计与 365 天电商经营

芯片设计

模型被要求设计一个用于加密方案的密码学电路模块,核心效率指标是逻辑门数量。它从一个可用但臃肿的 8,298 门设计出发,经过约 500 轮迭代将其削减到 678 门;再经开源工具 OpenROAD 自动布局后,芯片物理面积从 106×106 微米缩小到 46×46 微米,缩小 81%。官方称模型在数百轮迭代后仍在做深层结构修改,而非停留在表面微调。

E-Commerce-Bench:模拟经营一个财年

基于淘宝、天猫脱敏数据的电商经营模拟,模型以 10 万元初始资金并行经营多种店铺一整年(365 天),涉及 12 种店铺类型、60 个商品类目、近 600 家供应商和 7,000 种商品,需要在季节波动、供应链突发事件、议价与欺诈风险中持续调整采购、定价和库存。Qwen3.8-Max 在超过 2,000 轮交互后,将 10 万元初始资金运营为 416,252 元期末现金。

四、评测成绩

据钱江晚报与官方模型卡:

评测成绩
PaperBench(科研复现)93.0(较上代大幅提升 28.2 分,评测新高)
Terminal-Bench 2.186.6
FrontierSWE73.5
CoWorkBench74.8
SWE-bench Pro67.7(超过 GPT-5.6 Sol,略低于 Opus 4.8,据 CSDN 报道)
WideSearch81.9
Agent’s Last Exam52.4
IFBench(指令遵循)82.8
GPQA Diamond(科学推理)92.6
BabyVision(视觉推理,无工具)82.0(超出部分主流模型近两倍)
OSWorld-Verified(电脑操作)86.1(主流模型首位)

第三方榜单方面:Arena 全球排行榜中,阿里 Qwen 模型仅次于 Anthropic 的 Claude 系列,整体性能处于全球第一梯队(钱江晚报);CodeArena 编程榜中 Qwen3.8 位居全球第四。需要注意的是,官方成绩与 Opus 4.8、Fable 5、GPT 5.6 Sol 等模型相比各评测互有高低,且各评测的 Harness、超时时间、采样参数和上下文长度并不完全一致。

五、后训练:面向真实世界的扩展强化学习

为了让模型在琐碎、多步骤、重度依赖工具的真实工作流中足够稳定,Qwen 团队的 Agent 后训练概括为三个环节(摘自官方模型卡):

  1. 持续扩展真实环境并解耦独立维度:任务(单任务 → 多任务 → 跨天任务)、工作空间(多文件 → 层级目录 → 复杂异构目录)、Harness(不同类别、版本、技能)三个维度解耦,使环境数以组合方式自然增长,而非逐一定制集成;
  2. 统一奖励系统:将真实任务中异构的验证方式内化(基于执行的校验、对文本及渲染后视觉输出的 rubric 评估、agentic 检查),为所有环境提供一致可靠的奖励信号;
  3. 在线数据均衡器:对每个 batch 重构,使其在任务、难度、工作区与 harness 上分布高度均衡,降低 batch 间梯度方差,支撑 RL 训练算力稳定持续扩展。

六、价格与获取

  • API 已上线千问 AI 平台并接入「千问办公」:国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元;国际价格仅为 Opus 5 的 40%(输入)与 24%(输出)(钱江晚报);
  • 阿里同步推出 Token Plan 订阅模式,以 Lite/Standard/Pro 分级替代按 token 计量,夜间调用有折扣(CSDN 报道);
  • 开放权重:ModelScope(modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B),可通过 SGLang、vLLM、TokenSpeed 部署。

模型下载(命令摘自官方模型卡):

pip install -U modelscope
modelscope download \
  --model Qwen/Qwen3.8-2.4T-A95B \
  --local_dir ./Qwen3.8-2.4T-A95B

推荐采样参数:temperature=1.0, top_p=0.95, top_k=20;模型默认思考模式运行,reasoning_effort 支持 xhigh(默认)、medium、low 三档。

七、同期开源:Qwen3.8-27B

2026 年 8 月 14 日,阿里还开源了 Qwen3.8-27B:270 亿参数的原生多模态稠密(Dense)模型,支持 262K 原生上下文、YaRN 外推至 100 万 token,SWE-bench Pro 得分 61.7(据公开资料)。它与 2.4T 旗舰形成「一大一小」组合,官方在 27B 发布时预告「更小杯已在路上」。

八、开源节奏小结

时间事件
2026-08-03Qwen3.8-Max 发布,宣布首次开源 Max 级权重
2026-08-14Qwen3.8-27B(27B 原生多模态稠密模型)开源
2026-08-26Qwen3.8-Flash-Next 开源(Qwen4 架构早期预览,训练成本 1/9)

加上此前 Qwen3.5-Plus(3970 亿总参数、激活 170 亿)等版本,千问系列在 2026 年保持高频开源节奏,累计下载量已超过 30 亿次、衍生模型超过 30 万个(据公开报道)。

参考来源

  • Qwen 官方博客:Qwen3.8-Max: A New Bar for Coding and Cowork(qwen.ai/blog?id=qwen3.8,2026-08-03)
  • ModelScope 模型卡:Qwen/Qwen3.8-2.4T-A95B(含部署命令与后训练细节)
  • 钱江晚报·潮新闻《阿里「超大杯」Qwen3.8 正式发布》(2026-08-03)
  • The Decoder: Alibaba’s open-weight Qwen3.8-Max takes on long-horizon AI tasks with 2.4 trillion parameters
  • CSDN 相关评测报道(SWE-bench Pro 67.7、Token Plan 等)

本文为资讯类内容,摘录整理自下列公开资料(官方博客、模型卡与权威媒体报道),技术数字以官方原文为准,版权归原作者所有。

主要菜单