2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰基座大模型 Qwen3.8-Max,据钱江晚报报道,这是千问大模型系列中尺寸最大、性能最强的模型,总参数量 2.4 万亿,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。更重要的信号是:这是 Qwen-Max 级别模型的权重首次开源——开放权重于发布后一周放出(ModelScope / Hugging Face 上的模型名为 Qwen3.8-2.4T-A95B)。

一、模型规格
综合官方博客、ModelScope 模型卡与媒体报道:
| 项目 | 数值 |
|---|---|
| 总参数 | 2.4T |
| 每 token 激活参数 | 95B |
| MoE 结构 | 每层 512 个专家,每 token 选择 10 个路由专家 + 1 个共享专家 |
| 原生上下文 | 262,144 tokens(256K) |
| 扩展上下文 | 1,010,000 tokens(约 101 万) |
| 多 Token 预测(MTP) | 多步训练,支持相应推理引擎的多 token 预测 |
| 视觉理解 | 支持(多模态输入) |
| 思考模式 | 默认思考模式运行,不支持关闭;reasoning_effort 支持 xhigh(默认)/ medium / low |
架构上,Qwen3.8 延续 Qwen3.5 的混合架构(稀疏 MoE + 混合注意力机制联合优化),首次将千问大模型总参数量拓展至 2.4T。模型卡特别说明:「激活 95B」描述的是单 token 计算路径,不等同于模型权重或运行时显存只需 95B 规模。云端版 Qwen3.8-Max 基于该开放权重模型,并加入更多生产环境能力。
二、编程能力:三个「无人工介入」的自主编程案例
官方博客强调,对顶级模型而言,编程意味着「把一个真实的多天项目从空文件夹独立做到完成」。Qwen 团队展示了三个全程无人工帮助的挑战,共同主题是:模型通过反馈循环自我进化。
案例 1:10+ 天自主编程,构建自进化 Harness
Qwen3.8-Max 被要求从零创建 oh-my-cli 项目和一套可持续运行的编程 Harness:它将用户反馈、社区实践与自身自测结果纳入同一个工程循环——需求被规范化为 GitHub Issues,由 agent 通过状态机自动认领执行(ready → leased → active),完成后触发 E2E 测试与 CI 检查,通过后合并 PR。截至 2026 年 7 月 30 日,该流程在无人工介入的情况下连续运行约 16 天,累计 265 次 commit、127 个 PR、151 个 issue。完整轨迹公开在 GitHub 仓库 qwen-code-dev-bot/oh-my-cli。
案例 2:复现论文,然后做得更好
模型拿到研究论文《Unified Data Selection for LLM Reasoning》但没有起始代码,任务是先复现再改进。它连续工作约 125 小时(约 5 天),编写约 7,600 行代码,执行超过 1,100 步操作和 33 轮 GPU 训练:先复现了论文全部六项主要结论,随后在四轮探索中自主提出并验证 18 种改进方法,最终方案在 AIME24 数学基准受控实验中较复现基线再提高 2.71 分。
案例 3:24 小时打进人类竞赛前列
在阿里天池平台 WWW2025 多模态对话意图识别挑战赛中(526 支人类战队参赛),Qwen3.8-Max 在 24 小时内微调多个中文模型与 Qwen2.5-VL-7B(用于商品截图),并组合成投票系统,通过 45 次提交将准确率从 0.60 提升至 0.853,超越了 526 支人类战队中的 458 支。
三、长程任务:芯片设计与 365 天电商经营
芯片设计
模型被要求设计一个用于加密方案的密码学电路模块,核心效率指标是逻辑门数量。它从一个可用但臃肿的 8,298 门设计出发,经过约 500 轮迭代将其削减到 678 门;再经开源工具 OpenROAD 自动布局后,芯片物理面积从 106×106 微米缩小到 46×46 微米,缩小 81%。官方称模型在数百轮迭代后仍在做深层结构修改,而非停留在表面微调。
E-Commerce-Bench:模拟经营一个财年
基于淘宝、天猫脱敏数据的电商经营模拟,模型以 10 万元初始资金并行经营多种店铺一整年(365 天),涉及 12 种店铺类型、60 个商品类目、近 600 家供应商和 7,000 种商品,需要在季节波动、供应链突发事件、议价与欺诈风险中持续调整采购、定价和库存。Qwen3.8-Max 在超过 2,000 轮交互后,将 10 万元初始资金运营为 416,252 元期末现金。
四、评测成绩
据钱江晚报与官方模型卡:
| 评测 | 成绩 |
|---|---|
| PaperBench(科研复现) | 93.0(较上代大幅提升 28.2 分,评测新高) |
| Terminal-Bench 2.1 | 86.6 |
| FrontierSWE | 73.5 |
| CoWorkBench | 74.8 |
| SWE-bench Pro | 67.7(超过 GPT-5.6 Sol,略低于 Opus 4.8,据 CSDN 报道) |
| WideSearch | 81.9 |
| Agent’s Last Exam | 52.4 |
| IFBench(指令遵循) | 82.8 |
| GPQA Diamond(科学推理) | 92.6 |
| BabyVision(视觉推理,无工具) | 82.0(超出部分主流模型近两倍) |
| OSWorld-Verified(电脑操作) | 86.1(主流模型首位) |
第三方榜单方面:Arena 全球排行榜中,阿里 Qwen 模型仅次于 Anthropic 的 Claude 系列,整体性能处于全球第一梯队(钱江晚报);CodeArena 编程榜中 Qwen3.8 位居全球第四。需要注意的是,官方成绩与 Opus 4.8、Fable 5、GPT 5.6 Sol 等模型相比各评测互有高低,且各评测的 Harness、超时时间、采样参数和上下文长度并不完全一致。
五、后训练:面向真实世界的扩展强化学习
为了让模型在琐碎、多步骤、重度依赖工具的真实工作流中足够稳定,Qwen 团队的 Agent 后训练概括为三个环节(摘自官方模型卡):
- 持续扩展真实环境并解耦独立维度:任务(单任务 → 多任务 → 跨天任务)、工作空间(多文件 → 层级目录 → 复杂异构目录)、Harness(不同类别、版本、技能)三个维度解耦,使环境数以组合方式自然增长,而非逐一定制集成;
- 统一奖励系统:将真实任务中异构的验证方式内化(基于执行的校验、对文本及渲染后视觉输出的 rubric 评估、agentic 检查),为所有环境提供一致可靠的奖励信号;
- 在线数据均衡器:对每个 batch 重构,使其在任务、难度、工作区与 harness 上分布高度均衡,降低 batch 间梯度方差,支撑 RL 训练算力稳定持续扩展。
六、价格与获取
- API 已上线千问 AI 平台并接入「千问办公」:国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元;国际价格仅为 Opus 5 的 40%(输入)与 24%(输出)(钱江晚报);
- 阿里同步推出 Token Plan 订阅模式,以 Lite/Standard/Pro 分级替代按 token 计量,夜间调用有折扣(CSDN 报道);
- 开放权重:ModelScope(modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B),可通过 SGLang、vLLM、TokenSpeed 部署。
模型下载(命令摘自官方模型卡):
pip install -U modelscope
modelscope download \
--model Qwen/Qwen3.8-2.4T-A95B \
--local_dir ./Qwen3.8-2.4T-A95B
推荐采样参数:temperature=1.0, top_p=0.95, top_k=20;模型默认思考模式运行,reasoning_effort 支持 xhigh(默认)、medium、low 三档。
七、同期开源:Qwen3.8-27B
2026 年 8 月 14 日,阿里还开源了 Qwen3.8-27B:270 亿参数的原生多模态稠密(Dense)模型,支持 262K 原生上下文、YaRN 外推至 100 万 token,SWE-bench Pro 得分 61.7(据公开资料)。它与 2.4T 旗舰形成「一大一小」组合,官方在 27B 发布时预告「更小杯已在路上」。
八、开源节奏小结
| 时间 | 事件 |
|---|---|
| 2026-08-03 | Qwen3.8-Max 发布,宣布首次开源 Max 级权重 |
| 2026-08-14 | Qwen3.8-27B(27B 原生多模态稠密模型)开源 |
| 2026-08-26 | Qwen3.8-Flash-Next 开源(Qwen4 架构早期预览,训练成本 1/9) |
加上此前 Qwen3.5-Plus(3970 亿总参数、激活 170 亿)等版本,千问系列在 2026 年保持高频开源节奏,累计下载量已超过 30 亿次、衍生模型超过 30 万个(据公开报道)。
参考来源
- Qwen 官方博客:Qwen3.8-Max: A New Bar for Coding and Cowork(qwen.ai/blog?id=qwen3.8,2026-08-03)
- ModelScope 模型卡:Qwen/Qwen3.8-2.4T-A95B(含部署命令与后训练细节)
- 钱江晚报·潮新闻《阿里「超大杯」Qwen3.8 正式发布》(2026-08-03)
- The Decoder: Alibaba’s open-weight Qwen3.8-Max takes on long-horizon AI tasks with 2.4 trillion parameters
- CSDN 相关评测报道(SWE-bench Pro 67.7、Token Plan 等)
本文为资讯类内容,摘录整理自下列公开资料(官方博客、模型卡与权威媒体报道),技术数字以官方原文为准,版权归原作者所有。


