全球最大开源模型易主,Kimi K3 2.8 万亿参数全量开放

2026 年 7 月 27 日,月之暗面(Moonshot AI)兑现承诺,将最新旗舰大模型 Kimi K3 的完整模型权重面向全球开源社区发布(模型于 7 月 16 日率先上线 Kimi App)。K3 总参数达 2.8 万亿(2.8T)、每 token 激活 1040 亿(104B),是迄今发布的最大开源权重模型,官方称其为「世界首个开放的 3T 级模型」。据央视《焦点访谈》报道,将 2.8 万亿参数级别的旗舰模型全量开放,在全球范围内尚属首次。

Kimi K3 官方标识(图片来自 Kimi K3 官方 GitHub 仓库)
Kimi K3 官方标识(图片来自 Kimi K3 官方 GitHub 仓库)

官方 README 对模型的定位描述(原文):

Kimi K3 is an open-weight, native multimodal agentic model and our most capable model to date. It is a 2.8T-parameter model built on Kimi Delta Attention (KDA) and Attention Residuals (AttnRes), with native vision capabilities and a 1-million-token context window. It is the world’s first open 3T-class model, designed for frontier intelligence across long-horizon coding, knowledge work, and reasoning.

一、开源内容与时间线

  • 2026-07-16:Kimi K3 上线 Kimi App(官方当时承诺 7 月 27 日前放出权重);
  • 2026-07-27:完整模型权重在 Hugging Face 发布——共 120 个文件、96 个 safetensors 分片、总计约 1.56TB;技术报告随权重同步发布;
  • 发布次日统计约 99,000 次下载、7,300+ 点赞(Hugging Face);
  • 同期开源支撑 K3 训练的三项关键 Infra 技术:MoonEP、FlashKDA、AgentEnv
  • 代码仓库与模型权重均以 Kimi K3 License 发布。

二、架构规格

以下数据来自 Kimi K3 官方模型卡:

项目规格
架构混合专家(MoE)
总参数2.8T
激活参数(每 token)104B
层数93(含 1 层 Dense)
注意力层构成69 层 KDA + 24 层 Gated MLA
注意力隐藏维度 / 头数7168 / 96
专家配置896 个专家,每 token 选择 16 个,另有 2 个共享专家
词表大小160K
上下文长度1,048,576 tokens(100 万)
视觉编码器MoonViT-V2(401M 参数)
量化MXFP4 权重 / MXFP8 激活(从 SFT 阶段起量化感知训练,非事后量化)
模态文本、图像(Key Features 原文称同一模型内理解 text、images、video)

三、架构三大革新:扩展效率较 K2 提升约 2.5 倍

1. 混合注意力:KDA + Gated MLA

传统 Softmax 注意力在处理百万级上下文时,KV Cache 的内存占用会随序列增长而失控。K3 采用混合架构:KDA(Kimi Delta Attention,线性注意力)负责高效的长序列混合,把冗长上下文压缩进固定大小的循环状态;Gated MLA 保留精确检索能力。93 层中 69 层为 KDA、24 层为 Gated MLA。官方报告:在百万 token 上下文中解码速度最高提升 6.3 倍——这对智能体反复读取长代码、长文档的场景至关重要。

2. Attention Residuals(AttnRes)

极深网络中信息会层层损耗。AttnRes 允许当前层「跨级」直接读取之前各层的特征表示,相当于给模型装上直达电梯。官方数据:带来约 25% 的训练效率提升,额外计算开销 <2%。该技术于 2026 年早些时候先行开源,后并入 K3。一个 impressive 的实战演示:K3 对 AttnRes 训练内核做自我优化(96 层、8,192 维模型、8,192 tokens),15 小时不间断迭代后设计出两阶段内核算法,前向+反向耗时从 283.6ms 降至 114.4ms

3. Stable LatentMoE:896 选 16 的超稀疏 MoE

路由专家数增至 896、每 token 仅激活 16 个,如此极端的稀疏度通常会带来训练不稳定。K3 用两大手段解决:SiTU-GLU 激活函数(解决传统 SwiGLU 在极端规模下激活值爆炸问题)与 Quantile Balancing 分位数负载均衡(摒弃传统辅助损失函数,动态调整偏差,让 896 个专家「不闲着也不累坏」)。配合 MXFP4 量化感知训练,官方称整体扩展效率较 Kimi K2 提升约 2.5 倍

另一个值得注意的细节:视觉编码器 MoonViT-V2 完全从零训练,仅依赖后续 token 预测(可直接依据语言建模目标调整表征),训练全程保持稳定,视觉评估表现与 SigLIP 初始化的基线模型相当。

四、评测表现

官方模型卡成绩(reasoning_effort=max,节选)

基准Kimi K3Claude Fable 5GPT-5.6 SolOpus 4.8
GPQA Diamond93.592.694.191.0
HLE-Full(无工具/有工具)43.5 / 56.053.3 / 63.044.5 / 58.049.8 / 57.9
SWE-Marathon(长程编程)42.035.039.040.0
DeepSWE67.570.073.059.0
Terminal-Bench 2.188.388.088.884.6
FrontierSWE81.286.671.366.7
BrowseComp(深度搜索)91.288.090.484.3
MCPMark-Verified94.587.492.976.4
OSWorld-Verified84.885.083.083.4
OmniDocBench(文档解析)91.189.885.887.9
Harvey Lab-AA(法律)94.693.687.291.1

注:BrowseComp 91.2 使用了 300K token 处的上下文压缩策略;使用完整 1M 窗口无上下文管理时为 90.4,仍是同列最佳。

独立第三方评测

  • Artificial Analysis:Intelligence Index 57 分,开源权重模型第一(全榜仅 6 个变体更高,分属 3 个闭源模型:Claude Opus 5 为 61、Fable 5 为 60、GPT-5.6 Sol 为 59);开源对手 GLM-5.2 为 51、DeepSeek V4 Pro 为 44;Agentic Index 50.1 与 Coding 76.2 均为开源最佳;
  • Arena:WebDev 人类盲测榜 1,681.6 分第二(K3 上线时曾独占第一,7 月 24 日 Claude Opus 5 发布后反超);Agent 榜第一(0.148);
  • 据央视报道,K3 开源后在 Frontend Code Arena 前端代码竞技场以 1679 分登顶。

总体结论(Moonshot 官方自述 + 太平洋科技报道):K3 全面超越 Claude Opus 4.8、GLM-5.2 和 GPT-5.5,逼近最强闭源模型 Claude Fable 5 和 GPT-5.6 Sol;「虽然在整体表现上仍略微落后于最强大的闭源模型,但它已经稳稳确立了开源领域的全新边界」。

五、真实任务案例

技术报告展示的「极客任务」(据太平洋科技等报道):

  • 找出 Linux 内核 Zero-Day 漏洞:包括一个远程触发的堆越界写入和一个本地提权漏洞,已得到人类安全专家验证;
  • 爆改 GPU 编译器
  • 48 小时内设计一颗芯片(Nano-KPU)
  • 在模拟 Slack、Notion、Gmail 环境中扮演「员工」,处理跨越「虚拟数天」的超长待机任务。

六、后训练与训练 Infra

K3 的强化学习完全为「100 万 token 超长视距智能体」量身定制:

  • AgentEnv:基于微型虚拟机(microVM)的沙盒环境,模型在其中历经成百上千步:写代码、截图、查 Bug、自我修正;
  • 研发团队构建自我进化的知识图谱,让爬虫智能体在全网自动抓取、合成从天体物理到前端开发的高难度验证任务;
  • 交叉训练通用、智能体、代码三大领域的专家模型,在低、高、极限三个「思考努力」级别上做强化学习,最后通过多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation)浓缩为一个统一模型;
  • MoonEP:面向 MoE 训练的「零浪费专家并行」——通过在线整数线性规划和零拷贝通信,实现完全动态且绝对平衡的算力分配;
  • FlashKDA:重写底层推理引擎,让 KDA 的循环状态与 MLA 的 KV Cache 在同一内存池中共享复用——处理包含数十万字相同前缀的请求时,响应速度获得指数级提升(KDA 融合 Prefix Cache)。

七、许可证与 API 定价

Kimi K3 License(自定义许可,非 MIT):允许使用、复制、修改、分发、再许可、微调和商业销售,但附带两条 MIT 没有的条件——运营 model-as-a-service 业务且任意连续 12 个月收入超过 2000 万美元,须先与 Moonshot 签署单独协议;基于 K3 构建的产品若月活超过 1 亿或月收入超过 2000 万美元,须在界面显著展示「Kimi K3」名称。纯内部使用(模型输出不暴露给第三方)两条均豁免。对个人开发者、初创公司和研究团队实际影响为零;严格来说 K3 属于 open-weight 而非 open-source。

API 定价(platform.kimi.ai,OpenAI/Anthropic 兼容):

模型输入(缓存未命中)输入(缓存命中)输出上下文
kimi-k3$3.00$0.30$15.001,048,576
kimi-k2.6$0.95$0.16$4.00262,144
kimi-k2.5$0.60$0.10$3.00262,144

第三方分析指出:K3 比 Claude Opus 5 便宜 40%、比 Fable 5 便宜 70%,与 Claude Sonnet 5 价格相同但智能指数高出 4 分;缓存输入 90% 折扣对反复重发同一长上下文的场景意义重大。API 平台需至少充值 1 美元解锁 K3。

八、部署与使用

官方推荐的推理引擎:vLLM(recipes.vllm.ai/moonshotai/Kimi-K3)、SGLang(官方 cookbook)、TokenSpeed。需要注意:检查点大小 1.56TB,自托管需要多节点 GPU 集群才能以完整上下文服务——「对实验室和有正经基础设施的团队是真的,对只有单台工作站的个人不是」(第三方分析原文)。

K3 始终开启思考,会返回 reasoning_content;思考力度通过 reasoning_effort 字段配置,支持 lowhighmax(默认 max)。多轮对话与工具调用时须将含思考内容的完整 assistant 消息原样传回(preserved thinking),官方代码示例:

import openai

def chat_with_preserved_thinking(client: openai.OpenAI, model_name: str):
    messages = [
        {"role": "user", "content": "Tell me three random numbers."},
        {"role": "assistant",
         "reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.",
         "content": "473, 921, 235"},
        {"role": "user", "content": "What are the other two numbers you have in mind?"}
    ]

    response = client.chat.completions.create(
        model=model_name,
        messages=messages,
        stream=False,
        max_tokens=4096,
        reasoning_effort="max",
    )
    # the assistant should mention 215 and 222 that appear in the prior reasoning content
    print(f"response: {response.choices[0].message.reasoning}")
    return response.choices[0].message.content

编程场景官方推荐 Kimi Code CLI 作为 Agent 框架(kimi.com/code,终端中通过 /model 命令选择 Kimi K3),并兼容 Codex CLI、Claude Code、OpenCode、Hermes Agent 等主流编程工具。

九、市场反响与商业背景

  • 模型上线仅 48 小时,用户请求量大幅超出预估、逼近集群承载极限,月之暗面被迫宣布暂停 C 端新用户订阅(7 月 20 日),有业内观点将此次事件类比为「DeepSeek 2.0 时刻」(央视《焦点访谈》);
  • Kimi 系列产品 ARR 于 6 月中旬突破 3 亿美元;K2.6 于 2026 年 4 月开源后,年中成为 OpenRouter 上使用量第二大的模型;
  • Moonshot AI 正以最高 315 亿美元估值融资 10–20 亿美元,并据报道计划以最高 500 亿美元 pre-money 估值进行 IPO 前最后一轮融资(8 月启动谈判,香港上市或在 6 个月内);
  • K3 开源前后,近 200 家硅谷创始人联合表态支持开源,反对切断美国企业获取开源大模型的渠道。

参考来源

  • Kimi K3 官方 GitHub README 与 Hugging Face 模型卡(MoonshotAI/Kimi-K3)
  • 太平洋科技/新智元《刚刚,Kimi K3 正式开源!3 万亿模型权重全球开放》(2026-08-23)
  • 央视《焦点访谈》「开源共享赋能创新 中国 AI 智惠世界」(2026-08-20)
  • 北京市海淀区人民政府网站「我区企业月之暗面发布全球最大开源模型 Kimi K3」(2026-08-19)
  • Fello AI:Kimi K3 规格与定价分析(Intelligence Index、许可证条款、部署要求)

本文为资讯类内容,摘录整理自下列公开资料(官方博客、模型卡与权威媒体报道),技术数字以官方原文为准,版权归原作者所有。

主要菜单