DeepSeek V4 落地百万上下文,Pro 和 Flash 双版本一起开源

2026 年 4 月 24 日,DeepSeek 正式发布并开源 DeepSeek V4 系列大模型,包含 V4-ProV4-Flash 双版本,均采用混合专家(MoE)架构、原生支持百万级(1M token)上下文,并同时提供思考与非思考两种模式;API 兼容 OpenAI Chat Completions 与 Anthropic 接口,且全栈适配国产算力。此后数月,V4 系列经历多轮迭代,8 月中旬 V4-Pro-0813 正式版与代码智能体框架 Harness 同日推出,成为开源社区焦点。

AI 生成插图(示意图,非官方图片)
AI 生成插图(示意图,非官方图片)

一、双版本定位与规格

据公开技术资料:

模型总参数激活参数(每 token)定位
DeepSeek-V4-Pro约 1.6 万亿约 490 亿高阶推理、编程与 Agent
DeepSeek-V4-Flash约 2840 亿约 130 亿速度与成本效益
  • 两者均标配 100 万 token 上下文窗口
  • 模型权重以 MIT 许可证开放(4 月预览版权重,据第三方报道),支持免费商用;
  • V4-Pro 在 SWE-bench Verified 编程基准取得 80.6%(第三方报道),与 GPT-5.5、Claude Opus 4.7 等顶尖闭源模型处于同一梯队;
  • 官方模型卡将 V4 定位于通用智能体任务:读取较长材料、调用工具和完成多步工作。

二、版本演进时间线

时间事件
2026-04-24V4 预览版发布并开源(Pro / Flash 双版本,MIT 许可)
2026-06-27/28与北京大学联合推出并开源推理加速框架 DSpark
2026-07-31DeepSeek-V4-Flash-0731 正式版 API 上线公测
2026-08-03V4 Flash 正式版发布
2026-08-12/13V4-Pro-0813 正式版发布,同日推出代码智能体框架 Harness 公测版与配套 NPM 插件生态
2026-08-17API 新价格生效:V4 Pro 每百万 tokens 输入(缓存未命中)3 元、输出 6 元,缓存命中输入低至 0.025 元

三、V4-Pro-0813 正式版:搭载 DSpark 投机解码

据官方发布说明(编者摘要版),V4-Pro-0813 是 V4-Pro 预览版的正式迭代,基于预览版原生架构构建,额外搭载 DSpark 投机解码模块,智能体、代码、工具调用能力大幅升级,综合性能对标头部闭源大模型。几个关键工程细节:

  • 本次发布包未提供 Jinja 格式对话模板,配套提供 encoding 编码文件夹(Python 脚本),演示如何将 OpenAI 标准格式对话消息转换为模型输入文本、解析模型输出;
  • 新增 reasoning_effort(推理强度)参数,支持 low / high / max 三档;高推理档位下建议最大输出长度上限设为 384K token
  • 推荐采样参数:智能体场景 temperature=1.0、top_p=0.95;通用场景 top_p=1.0;
  • DSpark 投机解码与主模型共用同一套权重文件,vLLM/SGLang 均只需一行启动参数开启;
  • 权重与代码仓库采用 MIT 开源许可证(据官方发布说明;第三方站点 8 月 19 日核查发现 Hugging Face 仓库最后权重上传日期为 4 月 23 日——0813 托管版检查点是否同步放出,以官方仓库实际状态为准)。

官方基准成绩(V4-Pro-0813,DeepSeek Harness 最小模式、max reasoning):

基准V4 预览版V4-Pro-0813
Terminal-Bench 2.172.187.9
DeepSWE12.862.7
CyberGym52.783.3
DSBench-Hard(高难度编码)31.167.2
AutomationBench(公开集)12.831.8
Humanity’s Last Exam(带工具)48.260.0
Humanity’s Last Exam(无工具)37.742.7

其他官方成绩:Toolathlon-Verified 74.1、DSBench-FullStack 71.1(内部自研全栈开发测试集)。横向对比中,V4-Pro-0813 多数指标接近 Kimi K3、Claude Fable 5,部分领先、部分略逊。

四、Harness:MIT 许可的代码智能体框架

8 月 13 日随 0813 同日发布的 DeepSeek Harness,是一个 MIT 许可、插件优先(plugin-first)的 Agent 框架,被定位为 Claude Code 的开源替代;本周多位创作者的评测视频正是通过 Harness(而非裸 API)测试 V4 Pro。第三方实测反馈:模型在前端与一次性 UI 生成上最为突出(Three.js 场景、物理模拟、一次性应用克隆「视觉上可与前沿模型竞争」);被评述为会在提示模糊时主动提出澄清问题、擅长把大任务分解为有序步骤,但也有「对简单问题过度思考、过度工程化」的倾向。

Agent 工具公司 Composio 做了一个有趣的横向测试:把同一个 V4-Pro-0813 分别放进 5 套 Harness(统一 max reasoning,30 个多步骤 Agent 任务):

Harness通过率单次成功成本
Pi Agent21/30$0.031
DeepSeek Harness20/30$0.028(最省钱)
Claude Code19/30$0.074
OpenCode19/30$0.032
Hermes Agent18/30$0.037

速度上 Claude Code 最快(181.8 秒)、Pi 最慢(362.9 秒)。30 道题里 15 道五家全过、7 道全挂,剩下 8 道「只换了 Harness,结果就翻转」——这也说明智能体成绩是模型与脚手架的共同属性

五、独立评测:厂商数字需要打折看

多家独立评测机构给出了更「冷静」的画像,选型时值得参考:

  • Artificial Analysis:Intelligence Index 53 分,在约 106 个被跟踪模型中排名第三,与智谱 GLM-5.2 持平,落后 GPT-5.6 Terra 4 分、落后 Kimi K3 7 分;
  • CoderSera 中性 Harness 复测:Terminal-Bench 2.1 为 54.68%,与官方 87.9% 相差 33 个百分点;更值得注意的是,V4 Flash 在同一中性 Harness 下拿到 67.04%,反超了 Pro——这是「harness confound」(脚手架混淆)的典型信号;
  • 同一机构的中性测试中,SWE-bench Verified 为 96.40%(仅次于 Claude Opus 5 的 97.00%,且测试成本仅为其一小部分),说明差距并非单向;
  • 美国 NIST CAISI 对 4 月预览版的政府评测显示其安全配置与能力与西方前沿模型存在差距(网络安全 CTF 基准 32% vs GPT-5.5 的 71%),该评测针对预览版,0813 是否改善尚无独立结论。

结论是:单一头条数字不应被无条件信任,需要核对它出自哪套 Harness。DeepSeek 开源 Harness 本身(BENCHMARK.md 记录了以 jsonrpc-agent 最小模式跑基准)让脚手架可检视,这是一项真实贡献,但「可检视」不等于「已复现」。

六、部署

官方发布说明给出的部署要点:

# vLLM:单节点 4 张 GB300 显卡启动(一行参数开启 DSpark 投机解码)
vllm serve deepseek-ai/DeepSeek-V4-Pro-0813 \
  --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
  --data-parallel-size 4 --enable-expert-parallel \
  --moe-backend deep_gemm_mega_moe \
  --attention-config '{"use_fp4_indexer_cache": true}' \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

# SGLang:开启 DSpark 只需指定参数,无需单独草稿模型权重
sglang serve \
  --trust-remote-code \
  --model-path deepseek-ai/DeepSeek-V4-Pro-0813 \
  --tp4 \
  --moe-runner-backend flashinfer_mxfp4 \
  --speculative-algorithm DSPARK \
  --mem-fraction-static 0.90 \
  --chunked-prefill-size 4096 \
  --swa-full-tokens-ratio 0.1

消息编码示例(无 Jinja 模板,使用官方 encoding 脚本):

from encoding_dsv4 import encode_messages, parse_message_from_completion_text

messages = [
    {"role": "user", "content": "你好"},
    {"role": "assistant", "content": "你好!我是 DeepSeek。", "reasoning_content": "思考过程..."},
    {"role": "user", "content": "1+1等于几?"}
]

prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max")

七、开源生态影响

2026 年上半年,Kimi K3(2.8T)、DeepSeek V4-Pro(1.6T)、Qwen3.8-Max(2.4T)等万亿级参数模型相继开放权重,开源模型的参数规模与能力上限被不断刷新。V4 发布后,全球开发者社区对 DeepSeek 等中国开源模型的关注度明显升高(据公开报道)。另据公开信息:DeepSeek 于 2026 年 6 月完成首轮超 500 亿元人民币的外部融资;DSpark 推理加速框架系与北京大学联合推出并开源。截至本文撰写时,国内开源阵营已形成 DeepSeek、千问、Kimi、GLM 多强并立的格局,开源正在成为中国人工智能最鲜明的标识(央视《焦点访谈》)。

参考来源

  • DeepSeek-V4-Pro-0813 官方发布说明(编者摘要版:基准表、部署命令、MIT 许可)
  • 百度百科「DeepSeek」词条(V4 系列发布与版本时间线)
  • AI Tools Review: DeepSeek V4 Pro 0813 Benchmarks & Verdict(独立评测与 NIST CAISI 数据)
  • BlockBeats/动察:Composio 五套 Harness 对比测试
  • Nerd Level Tech: DeepSeek Harness 开源分析与定价(权重发布状态核查)
  • 中国经济新闻网、Future Factors、Studio Global 等第三方报道(V4 规格与 SWE-bench Verified 80.6%)

本文为资讯类内容,摘录整理自下列公开资料(官方博客、模型卡与权威媒体报道),技术数字以官方原文为准,版权归原作者所有。

主要菜单