2026 年 7 月 27 日,月之暗面(Moonshot AI)兑现承诺,将最新旗舰大模型 Kimi K3 的完整模型权重面向全球开源社区发布(模型于 7 月 16 日率先上线 Kimi App)。K3 总参数达 2.8 万亿(2.8T)、每 token 激活 1040 亿(104B),是迄今发布的最大开源权重模型,官方称其为「世界首个开放的 3T 级模型」。据央视《焦点访谈》报道,将 2.8 万亿参数级别的旗舰模型全量开放,在全球范围内尚属首次。

官方 README 对模型的定位描述(原文):
Kimi K3 is an open-weight, native multimodal agentic model and our most capable model to date. It is a 2.8T-parameter model built on Kimi Delta Attention (KDA) and Attention Residuals (AttnRes), with native vision capabilities and a 1-million-token context window. It is the world’s first open 3T-class model, designed for frontier intelligence across long-horizon coding, knowledge work, and reasoning.
一、开源内容与时间线
- 2026-07-16:Kimi K3 上线 Kimi App(官方当时承诺 7 月 27 日前放出权重);
- 2026-07-27:完整模型权重在 Hugging Face 发布——共 120 个文件、96 个 safetensors 分片、总计约 1.56TB;技术报告随权重同步发布;
- 发布次日统计约 99,000 次下载、7,300+ 点赞(Hugging Face);
- 同期开源支撑 K3 训练的三项关键 Infra 技术:MoonEP、FlashKDA、AgentEnv;
- 代码仓库与模型权重均以 Kimi K3 License 发布。
二、架构规格
以下数据来自 Kimi K3 官方模型卡:
| 项目 | 规格 |
|---|---|
| 架构 | 混合专家(MoE) |
| 总参数 | 2.8T |
| 激活参数(每 token) | 104B |
| 层数 | 93(含 1 层 Dense) |
| 注意力层构成 | 69 层 KDA + 24 层 Gated MLA |
| 注意力隐藏维度 / 头数 | 7168 / 96 |
| 专家配置 | 896 个专家,每 token 选择 16 个,另有 2 个共享专家 |
| 词表大小 | 160K |
| 上下文长度 | 1,048,576 tokens(100 万) |
| 视觉编码器 | MoonViT-V2(401M 参数) |
| 量化 | MXFP4 权重 / MXFP8 激活(从 SFT 阶段起量化感知训练,非事后量化) |
| 模态 | 文本、图像(Key Features 原文称同一模型内理解 text、images、video) |
三、架构三大革新:扩展效率较 K2 提升约 2.5 倍
1. 混合注意力:KDA + Gated MLA
传统 Softmax 注意力在处理百万级上下文时,KV Cache 的内存占用会随序列增长而失控。K3 采用混合架构:KDA(Kimi Delta Attention,线性注意力)负责高效的长序列混合,把冗长上下文压缩进固定大小的循环状态;Gated MLA 保留精确检索能力。93 层中 69 层为 KDA、24 层为 Gated MLA。官方报告:在百万 token 上下文中解码速度最高提升 6.3 倍——这对智能体反复读取长代码、长文档的场景至关重要。
2. Attention Residuals(AttnRes)
极深网络中信息会层层损耗。AttnRes 允许当前层「跨级」直接读取之前各层的特征表示,相当于给模型装上直达电梯。官方数据:带来约 25% 的训练效率提升,额外计算开销 <2%。该技术于 2026 年早些时候先行开源,后并入 K3。一个 impressive 的实战演示:K3 对 AttnRes 训练内核做自我优化(96 层、8,192 维模型、8,192 tokens),15 小时不间断迭代后设计出两阶段内核算法,前向+反向耗时从 283.6ms 降至 114.4ms。
3. Stable LatentMoE:896 选 16 的超稀疏 MoE
路由专家数增至 896、每 token 仅激活 16 个,如此极端的稀疏度通常会带来训练不稳定。K3 用两大手段解决:SiTU-GLU 激活函数(解决传统 SwiGLU 在极端规模下激活值爆炸问题)与 Quantile Balancing 分位数负载均衡(摒弃传统辅助损失函数,动态调整偏差,让 896 个专家「不闲着也不累坏」)。配合 MXFP4 量化感知训练,官方称整体扩展效率较 Kimi K2 提升约 2.5 倍。
另一个值得注意的细节:视觉编码器 MoonViT-V2 完全从零训练,仅依赖后续 token 预测(可直接依据语言建模目标调整表征),训练全程保持稳定,视觉评估表现与 SigLIP 初始化的基线模型相当。
四、评测表现
官方模型卡成绩(reasoning_effort=max,节选)
| 基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Opus 4.8 |
|---|---|---|---|---|
| GPQA Diamond | 93.5 | 92.6 | 94.1 | 91.0 |
| HLE-Full(无工具/有工具) | 43.5 / 56.0 | 53.3 / 63.0 | 44.5 / 58.0 | 49.8 / 57.9 |
| SWE-Marathon(长程编程) | 42.0 | 35.0 | 39.0 | 40.0 |
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 |
| Terminal-Bench 2.1 | 88.3 | 88.0 | 88.8 | 84.6 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 |
| BrowseComp(深度搜索) | 91.2 | 88.0 | 90.4 | 84.3 |
| MCPMark-Verified | 94.5 | 87.4 | 92.9 | 76.4 |
| OSWorld-Verified | 84.8 | 85.0 | 83.0 | 83.4 |
| OmniDocBench(文档解析) | 91.1 | 89.8 | 85.8 | 87.9 |
| Harvey Lab-AA(法律) | 94.6 | 93.6 | 87.2 | 91.1 |
注:BrowseComp 91.2 使用了 300K token 处的上下文压缩策略;使用完整 1M 窗口无上下文管理时为 90.4,仍是同列最佳。
独立第三方评测
- Artificial Analysis:Intelligence Index 57 分,开源权重模型第一(全榜仅 6 个变体更高,分属 3 个闭源模型:Claude Opus 5 为 61、Fable 5 为 60、GPT-5.6 Sol 为 59);开源对手 GLM-5.2 为 51、DeepSeek V4 Pro 为 44;Agentic Index 50.1 与 Coding 76.2 均为开源最佳;
- Arena:WebDev 人类盲测榜 1,681.6 分第二(K3 上线时曾独占第一,7 月 24 日 Claude Opus 5 发布后反超);Agent 榜第一(0.148);
- 据央视报道,K3 开源后在 Frontend Code Arena 前端代码竞技场以 1679 分登顶。
总体结论(Moonshot 官方自述 + 太平洋科技报道):K3 全面超越 Claude Opus 4.8、GLM-5.2 和 GPT-5.5,逼近最强闭源模型 Claude Fable 5 和 GPT-5.6 Sol;「虽然在整体表现上仍略微落后于最强大的闭源模型,但它已经稳稳确立了开源领域的全新边界」。
五、真实任务案例
技术报告展示的「极客任务」(据太平洋科技等报道):
- 找出 Linux 内核 Zero-Day 漏洞:包括一个远程触发的堆越界写入和一个本地提权漏洞,已得到人类安全专家验证;
- 爆改 GPU 编译器;
- 48 小时内设计一颗芯片(Nano-KPU);
- 在模拟 Slack、Notion、Gmail 环境中扮演「员工」,处理跨越「虚拟数天」的超长待机任务。
六、后训练与训练 Infra
K3 的强化学习完全为「100 万 token 超长视距智能体」量身定制:
- AgentEnv:基于微型虚拟机(microVM)的沙盒环境,模型在其中历经成百上千步:写代码、截图、查 Bug、自我修正;
- 研发团队构建自我进化的知识图谱,让爬虫智能体在全网自动抓取、合成从天体物理到前端开发的高难度验证任务;
- 交叉训练通用、智能体、代码三大领域的专家模型,在低、高、极限三个「思考努力」级别上做强化学习,最后通过多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation)浓缩为一个统一模型;
- MoonEP:面向 MoE 训练的「零浪费专家并行」——通过在线整数线性规划和零拷贝通信,实现完全动态且绝对平衡的算力分配;
- FlashKDA:重写底层推理引擎,让 KDA 的循环状态与 MLA 的 KV Cache 在同一内存池中共享复用——处理包含数十万字相同前缀的请求时,响应速度获得指数级提升(KDA 融合 Prefix Cache)。
七、许可证与 API 定价
Kimi K3 License(自定义许可,非 MIT):允许使用、复制、修改、分发、再许可、微调和商业销售,但附带两条 MIT 没有的条件——运营 model-as-a-service 业务且任意连续 12 个月收入超过 2000 万美元,须先与 Moonshot 签署单独协议;基于 K3 构建的产品若月活超过 1 亿或月收入超过 2000 万美元,须在界面显著展示「Kimi K3」名称。纯内部使用(模型输出不暴露给第三方)两条均豁免。对个人开发者、初创公司和研究团队实际影响为零;严格来说 K3 属于 open-weight 而非 open-source。
API 定价(platform.kimi.ai,OpenAI/Anthropic 兼容):
| 模型 | 输入(缓存未命中) | 输入(缓存命中) | 输出 | 上下文 |
|---|---|---|---|---|
| kimi-k3 | $3.00 | $0.30 | $15.00 | 1,048,576 |
| kimi-k2.6 | $0.95 | $0.16 | $4.00 | 262,144 |
| kimi-k2.5 | $0.60 | $0.10 | $3.00 | 262,144 |
第三方分析指出:K3 比 Claude Opus 5 便宜 40%、比 Fable 5 便宜 70%,与 Claude Sonnet 5 价格相同但智能指数高出 4 分;缓存输入 90% 折扣对反复重发同一长上下文的场景意义重大。API 平台需至少充值 1 美元解锁 K3。
八、部署与使用
官方推荐的推理引擎:vLLM(recipes.vllm.ai/moonshotai/Kimi-K3)、SGLang(官方 cookbook)、TokenSpeed。需要注意:检查点大小 1.56TB,自托管需要多节点 GPU 集群才能以完整上下文服务——「对实验室和有正经基础设施的团队是真的,对只有单台工作站的个人不是」(第三方分析原文)。
K3 始终开启思考,会返回 reasoning_content;思考力度通过 reasoning_effort 字段配置,支持 low、high、max(默认 max)。多轮对话与工具调用时须将含思考内容的完整 assistant 消息原样传回(preserved thinking),官方代码示例:
import openai
def chat_with_preserved_thinking(client: openai.OpenAI, model_name: str):
messages = [
{"role": "user", "content": "Tell me three random numbers."},
{"role": "assistant",
"reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.",
"content": "473, 921, 235"},
{"role": "user", "content": "What are the other two numbers you have in mind?"}
]
response = client.chat.completions.create(
model=model_name,
messages=messages,
stream=False,
max_tokens=4096,
reasoning_effort="max",
)
# the assistant should mention 215 and 222 that appear in the prior reasoning content
print(f"response: {response.choices[0].message.reasoning}")
return response.choices[0].message.content
编程场景官方推荐 Kimi Code CLI 作为 Agent 框架(kimi.com/code,终端中通过 /model 命令选择 Kimi K3),并兼容 Codex CLI、Claude Code、OpenCode、Hermes Agent 等主流编程工具。
九、市场反响与商业背景
- 模型上线仅 48 小时,用户请求量大幅超出预估、逼近集群承载极限,月之暗面被迫宣布暂停 C 端新用户订阅(7 月 20 日),有业内观点将此次事件类比为「DeepSeek 2.0 时刻」(央视《焦点访谈》);
- Kimi 系列产品 ARR 于 6 月中旬突破 3 亿美元;K2.6 于 2026 年 4 月开源后,年中成为 OpenRouter 上使用量第二大的模型;
- Moonshot AI 正以最高 315 亿美元估值融资 10–20 亿美元,并据报道计划以最高 500 亿美元 pre-money 估值进行 IPO 前最后一轮融资(8 月启动谈判,香港上市或在 6 个月内);
- K3 开源前后,近 200 家硅谷创始人联合表态支持开源,反对切断美国企业获取开源大模型的渠道。
参考来源
- Kimi K3 官方 GitHub README 与 Hugging Face 模型卡(MoonshotAI/Kimi-K3)
- 太平洋科技/新智元《刚刚,Kimi K3 正式开源!3 万亿模型权重全球开放》(2026-08-23)
- 央视《焦点访谈》「开源共享赋能创新 中国 AI 智惠世界」(2026-08-20)
- 北京市海淀区人民政府网站「我区企业月之暗面发布全球最大开源模型 Kimi K3」(2026-08-19)
- Fello AI:Kimi K3 规格与定价分析(Intelligence Index、许可证条款、部署要求)
本文为资讯类内容,摘录整理自下列公开资料(官方博客、模型卡与权威媒体报道),技术数字以官方原文为准,版权归原作者所有。


